← Back to roles

混元语音大模型agentic评测(北京/上海)

Tencent Technology (Shenzhen) Co., Ltd.

深圳Posted Aug 11, 2026via generic-json
Apply on Tencent Technology (Shenzhen) Co., Ltd.
1.主导 Agent 方向评测体系整体设计与落地实施,完成模型能力定义,搭建面向复杂智能体场景的评测任务体系;围绕多步推理、环境交互、工具编排、长程规划、异常错误恢复等核心维度,搭建贴合真实 Agentic 工作流的端到端评测方案; 2.搭建评测数据全链路质量管控体系,落地试题查重、数据污染检测、难度分级标定校准、标注规范制定、标注一致性审核等机制,保障评测结果可信、稳定、可复现; 3.联动模型训练团队深度对齐,提炼评测结论与优化洞察,输出模型能力迭代改进方向;协同工程团队推进评测基础设施建设,搭建可支撑高频次、大规模自动化评测的流水线; 4.持续跟进 Agent 领域学术界、工业界前沿技术动态,输出评测体系迭代演进策略,持续优化评测方案,精准衡量大模型智能体真实能力边界; 5.探索融合多模态能力的 Agentic 评测新思路、新方案,并完成方案验证与落地实施。

Source URL: http://careers.tencent.com/jobdesc.html?postId=2077312441141866496

混元语音大模型agentic评测(北京/上海) at Tencent Technology (Shenzhen) Co., Ltd. — 深圳 · RISC-V Jobs