混元Agent后训练算法工程师(北京/上海/深圳)
Tencent Technology (Shenzhen) Co., Ltd.
北京Posted Aug 11, 2026via generic-json
1.Agent 后训练算法设计与实现:主导基模大模型的 Agent 化后训练方案研发,包括指令微调(SFT)、奖励模型(RM)训练、强化学习(RLHF/RLAIF)优化,聚焦任务规划、记忆机制、工具调用、多轮对话一致性等核心能力提升。;
2.后训练数据体系构建:设计 Agent 后训练数据的采集、清洗、标注与迭代策略,涵盖通用指令集、任务型对话数据、工具调用样本、多模态交互数据等,建立数据质量评估与筛选机制,优化数据分布与多样性。;
3.Agent 能力优化与突破:针对 Agent 在复杂任务拆解、跨领域知识迁移、动态环境适配等场景的痛点,研发创新后训练算法(如分层任务规划训练、多智能体协作训练、反幻觉优化),提升 Agent 的决策准确性与鲁棒性。;
4.工程化落地与系统协作:搭建高高效后训练流水线,支持大规模数据并行处理、分布式训练(DDP/FSDP)与模型压缩部署;与产品、工程团队协作,打通 “后训练 - 评测 - 迭代” 闭环,适配不同场景下的 Agent 产品需求。;
5.技术创新与沉淀:跟踪大模型 Agent 领域前沿技术(如 LLM+Planning、Tool Learning、Multi-Agent Interaction),主导核心技术攻关与专利申请;输出可复用的后训练算法组件、技术文档与评测基准,推动团队技术能力沉淀。
Source URL: http://careers.tencent.com/jobdesc.html?postId=2068941068765933568