混元Agentic Vision算法研究员(北京/上海)(深圳)
Tencent Technology (Shenzhen) Co., Ltd.
北京Posted Aug 25, 2026via generic-json
1.主导 Visual2Code 能力建设:负责多模态大语言模型在 Visual2Code 方向的核心算法研发,围绕“视觉输入—代码理解—代码生成—执行验证”完整链路,持续提升模型从界面、图表、文档、图像等视觉信息中理解结构并生成高质量代码的能力;
2.建设高质量数据体系:负责 Visual2Code 训练数据的设计、构建与迭代,包括真实数据挖掘、自动化数据合成、难度分层、质量过滤及数据配比等,建立覆盖多场景、多语言、多任务形态的数据生产与数据飞轮体系;
3.推进模型与算法创新:深入探索 Visual2Code 场景下的 SFT、强化学习、代码执行反馈、Verifier/Reward Model 等后训练方法,研究视觉理解、代码推理与执行反馈之间的协同机制,持续提升模型在复杂任务中的正确率、泛化能力与稳定性;
4.强化复杂视觉编程能力:聚焦视觉结构解析、布局理解、图表/文档理解、视觉逻辑推理以及代码生成等关键能力,提升模型从复杂视觉输入中完成结构还原、逻辑抽取、程序生成与迭代修正的能力;
5.建设系统化评测体系:搭建 Visual2Code 能力评测与诊断体系,从视觉感知、结构理解、代码正确性、执行结果、视觉还原度、复杂推理等维度建立 Benchmark 与自动化评测链路,持续定位模型能力瓶颈并指导训练迭代;
6.探索 Agentic Vision 新范式:探索视觉模型与代码执行、工具调用、环境反馈等能力的结合,推动模型从一次性 Visual2Code 生成进一步走向“理解—生成—执行—观察—修正”的 Agentic Vision 闭环,提升模型自主解决复杂视觉任务的能力。
Source URL: http://careers.tencent.com/jobdesc.html?postId=2092149663925977088