混元多模态强化学习(RL)算法研究员(北京/上海)
Tencent Technology (Shenzhen) Co., Ltd.
深圳Posted Aug 11, 2026via generic-json
1.针对多模态模型开展强化学习算法研究,包括面向图像、视频生成的扩散模型,面向多模态理解的自回归模型,以及前沿统一多模态框架;
2.设计并开发强化学习训练框架与奖励建模策略,实现高效的大规模训练,提升训练稳定性,并解决奖励作弊等相关问题;
3.探索下一代强化学习范式,使其能更直接、更高效地从环境反馈中学习。
Source URL: http://careers.tencent.com/jobdesc.html?postId=2034532284522196992