混元语音大模型agentic评测(北京/上海)
Tencent Technology (Shenzhen) Co., Ltd.
深圳Posted Aug 11, 2026via generic-json
1.主导 Agent 方向评测体系整体设计与落地实施,完成模型能力定义,搭建面向复杂智能体场景的评测任务体系;围绕多步推理、环境交互、工具编排、长程规划、异常错误恢复等核心维度,搭建贴合真实 Agentic 工作流的端到端评测方案;
2.搭建评测数据全链路质量管控体系,落地试题查重、数据污染检测、难度分级标定校准、标注规范制定、标注一致性审核等机制,保障评测结果可信、稳定、可复现;
3.联动模型训练团队深度对齐,提炼评测结论与优化洞察,输出模型能力迭代改进方向;协同工程团队推进评测基础设施建设,搭建可支撑高频次、大规模自动化评测的流水线;
4.持续跟进 Agent 领域学术界、工业界前沿技术动态,输出评测体系迭代演进策略,持续优化评测方案,精准衡量大模型智能体真实能力边界;
5.探索融合多模态能力的 Agentic 评测新思路、新方案,并完成方案验证与落地实施。
Source URL: http://careers.tencent.com/jobdesc.html?postId=2077312441141866496