基础多模态大模型训练
Company Antgroup
Focus Tech · Algorithm
Location 上海, 杭州
Published July 22, 2026
岗位职责
面向多模态基础模型能力建设,负责图像、视频、文本、音频等多模态模型的训练与优化,包括预训练、后训练、跨模态对齐和能力增强,持续提升模型在多模态理解与生成方面的表现。
-
原生多模训练 负责全模态原生训练方案推进,实现音频/视频/图片/文本 在语义层面的深度对齐,持续优化训练阶段 和 全模态数据质量
-
全模态强化学习与对齐 构建全模态强化学习框架,将RL输入从纯文本 拓展至 音频/视频/图片/文本 全模态序列,优化模型跨模态推演能力同时,实现全模态间的协同进化。 利用生成式奖励模型(Reward Model)与细粒度的人类偏好学习,在审美、情感、文化等感性维度 和 人类偏好 进行对齐。
-
视觉驱动的行动力优化 推动模型从“认知工具”演进为具备高阶行动力的智能体。负责以视觉为中心的前端代码合成 和 工具调用(Vision-centric coding/Tool Use),通过引入视觉反馈闭环提升模型纠错能力, 实现从像素级视觉输入到高保真前端代码的端到端转换。
-
图像/视频可控生成 负责研发多维度生成控制与编辑技术,支持内容增删改、风格迁移及属性调整,提升多轮交互编辑的精度与自然度,实现“AI版PS”式的可控图像生成及编辑。
-
数据和评测体系 参与多模态大模型数据体系与模型评测体系建设,覆盖数据采集、清洗、标注、增强及多维度能力评估,建设基于Agent驱动的数据合成链路,实现对模型效果的量化分析与持续迭代。
-
语音理解 参与语音识别方向的能力建设与持续优化,提升模型在多方言、多口音、多噪声场景下的准确率与鲁棒性,推动模型的识别能力从转录向细粒度、深度语义理解延伸。
-
语音/音乐生成 参与语音合成与音乐生成方向的能力建设与迭代优化,提升合成语音的自然度、表现力与可控性,推动音乐生成在旋律、编曲、风格迁移等维度的质量提升。
-
语音对话 参与端到端语音对话方向的能力建设,涵盖语音输入理解、对话生成与语音输出的效果提升,优化模型在实时性、上下文建模与多轮交互体验上的表现。
任职要求
基础要求
-
学历背景:计算机、数学、统计学等相关专业硕士/博士优先,优秀本科生不受限制;
-
编程功底:熟练掌握 Python 编程语言,熟悉主流深度学习框架(如 PyTorch);熟悉常用的大数据处理框架(如 Spark、Hadoop 等);
-
理论基础:具备扎实的机器学习、深度学习理论基础,了解自然语言处理(NLP)或多模态大模型的基本架构与原理。 专业能力
-
熟悉图像、视频、文本等多模态数据处理流程和工具;
-
熟悉常见的多模态预训练、跨模态对齐、理解/生成模型,并有实际训练 或 应用经验;
-
熟悉 Transformer/Diffusion 等大模型结构原理、分布式调度系统、大模型训练/推理/Agent 系统、高性能软硬件架构等任一领域的专业知识;
-
能够熟练阅读多模态前沿论文,并有论文复现能力。 加分项
-
顶级竞赛:参加过国内外知名算法竞赛(如 Kaggle、ICPC、ACM等)或信息学、数学、物理等学科奥林匹克竞赛,并取得优异成绩;
-
学术视野:在顶级国际会议/期刊(如 NeurIPS、ICML、ICLR、ACL、CVPR 等)以主要作者身份发表过 AI 相关论文;
-
开源贡献:有算法工程化落地经验,在主流大模型开源社区或算法库(如 HuggingFace、Megatron 等)有代码开发、维护或 PR 贡献经历。
特色标签
Agent驱动数据合成、Python、RLHF、TensorFlow/PyTorch、Transformer结构、云服务、云计算、人类偏好对齐、优秀开源项目经历、全模态模型、内容、分布式训练、医疗、原生预训练、参加算法相关竞赛/获奖、发表算法相关优秀论文、可控生成、图像、图像处理库(OpenCV等)、图像生成、图像算法、多模态大模型、多模态算法、多模态融合、多模态评估体系、多轮语音对话、大数据、大数据处理工具(Spark/Hadoop/Hive)、大模型架构、大模型算法、大规模预训练、对话系统、并行计算、广告、强化学习、扩散模型、搜索、教育、数学/统计相关专业、数据安全、文娱、文本生成、新媒体、方言识别、旋律生成、智能体、有国际期刊/会议论文发表、有留学背景、机器人、机器学习、标注、模型量化分析、模态对齐、深度学习、生成式奖励模型、直播、短视频、端到端语音对话、算法工程化经验、聊天机器人、自动驾驶、自然语言处理算法、自监督预训练、视觉内容生成、视频、视频生成、计算机相关专业、语义对齐、语义理解、语音、语音交互、语音合成、语音算法、语音识别、语音识别工作经验、跨模态模型、音乐合成、鲁棒语音识别