← Back to roles

AI Infra强化学习工程师-深圳/北京/上海

Tencent Technology (Shenzhen) Co., Ltd.

上海Posted Aug 11, 2026via generic-json
Apply on Tencent Technology (Shenzhen) Co., Ltd.
1.负责LLM RL、Agentic RL强化学习训练框架的设计、开发与性能优化,支撑大规模 RL 算法(如 PPO、DQN、GRPO等)的高效落地; 2.构建分布式训练体系,优化训推异步、partial rollout、数据并行、模型并行、Replay Buffer分布式存储与调度策略,提升 GPU 利用率与训练吞吐; 3.设计并实现 RL 训练全流程工具链:包括环境封装、数据预处理、模型版本管理、训练日志监控、指标可可视化(TensorBoard/Weights & Biases)等; 4.解决 RL 训练中的工程瓶颈:如样本传输延迟、GPU 显存溢出、训练稳定性(梯度爆炸 / 消失)等问题,提供工程化解决方案; 5.与 RL 算法团队紧密协作,理解算法需求并迭代基础设施,适配多场景的训练需求; 6.跟进强化学习与分布式训练领域的前沿技术(如 VERL、rllm、Agentlightning、Ray、Megatron-LM等),并落地到实际系统中。

Source URL: http://careers.tencent.com/jobdesc.html?postId=2038796569410695168

AI Infra强化学习工程师-深圳/北京/上海 at Tencent Technology (Shenzhen) Co., Ltd. — 上海 · RISC-V Jobs