混元Agentic Vision算法研究员(北京/上海)(深圳)Company TencentFocus Tech · AlgorithmLocation 北京Published August 24, 2026岗位职责 主导 Visual2Code 能力建设:负责多模态大语言模型在 Visual2Code 方向的核心算法研发,围绕“视觉输入—代码理解—代码生成—执行验证”完整链路,持续提升模型从界面、图表、文档、图像等视觉信息中理解结构并生成高质量代码的能力; 建设高质量数据体系:负责 Visual2Code 训练数据的设计、构建与迭代,包括真实数据挖掘、自动化数据合成、难度分层、质量过滤及数据配比等,建立覆盖多场景、多语言、多任务形态的数据生产与数据飞轮体系; 推进模型与算法创新:深入探索 Visual2Code 场景下的 SFT、强化学习、代码执行反馈、Verifier/Reward Model 等后训练方法,研究视觉理解、代码推理与执行反馈之间的协同机制,持续提升模型在复杂任务中的正确率、泛化能力与稳定性; 强化复杂视觉编程能力:聚焦视觉结构解析、布局理解、图表/文档理解、视觉逻辑推理以及代码生成等关键能力,提升模型从复杂视觉输入中完成结构还原、逻辑抽取、程序生成与迭代修正的能力; 建设系统化评测体系:搭建 Visual2Code 能力评测与诊断体系,从视觉感知、结构理解、代码正确性、执行结果、视觉还原度、复杂推理等维度建立 Benchmark 与自动化评测链路,持续定位模型能力瓶颈并指导训练迭代; 探索 Agentic Vision 新范式:探索视觉模型与代码执行、工具调用、环境反馈等能力的结合,推动模型从一次性 Visual2Code 生成进一步走向“理解—生成—执行—观察—修正”的 Agentic Vision 闭环,提升模型自主解决复杂视觉任务的能力。 任职要求 计算机视觉、人工智能、机器学习、计算机科学等相关方向硕士及以上学历,具备扎实的深度学习与编程基础; 在多模态大模型、代码大模型、Agent、视觉理解或相关方向具有研究或研发经验; 熟悉 Transformer、LLM、VLM 等模型架构,对 SFT、强化学习、代码生成与执行反馈等技术有较深入理解; 具备较强的数据构建、算法研究与实验分析能力,能够独立推动从数据、模型、训练到评测的完整研发闭环; 对 Visual2Code、Agentic Vision 及多模态智能方向具有强烈兴趣,能够持续跟进并探索前沿技术。 产品/项目 混元-模型算法 工作年限 三年以上工作经验