蚂蚁集团-语言大模型语料优化算法工程师-北京/杭州【AGI专项】
Company Antgroup
Focus Tech · Algorithm
Location 北京, 杭州
Published August 3, 2026
岗位职责
团队主要负责蚂蚁集团大语言模型的语料优化,涵盖数据扩源、数据质量提升、合成语料、数据利用方式优化、数学/代码/推理/对话能力提升等多个方向。我们致力于通过数据驱动的方式打造业界一流的语言基座模型。
- 负责大语言模型各阶段训练语料的优化工作,包括预训练、后训练、强化学习训练阶段,具体的工作包括体系化地扩展各类型的数据、定义并迭代优化数据质量、建设高效的合成语料技术、优化高质量数据筛选策略、优化数据配比及训练策略等。
- 负责端到端地优化基座模型的各项关键能力,包括数学、代码、推理、对话等能力,具体工作包括扩展各能力相关的语料、定义并迭代优化数据质量、针对性地合成相关语料、优化高质量数据筛选策略、优化各阶段数据配比及训练策略、优化评测方式等。
- 负责研发语料优化相关的基础设施,包括研发高效的数据处理算子及链路、构建数据标签体系及标注模型、探索数据与模型效果的关系、设计数据效果评估机制等。
- 跟踪和研究大模型领域的前沿技术方向,包括但不限于语料优化、预训练和后训练算法、知识增强、数据合成等,推动技术创新并应用到基座模型训练中。
任职要求
- 硕士及以上学历,计算机科学、人工智能或相关专业背景。
- 熟练掌握机器学习、自然语言处理、大语言模型等相关领域的基本理论和算法,具备扎实的数学基础。
- 熟练掌握Python编程语言,熟悉主流深度学习框架(如PyTorch),具备大规模数据处理和分布式训练的实际经验。
- 具备良好的分析和解决问题能力,能够独立思考并解决复杂的技术问题。
- 具备较强的团队合作能力和沟通能力,能够与工程、产品等团队紧密配合,共同推动项目落地。
- 热爱人工智能领域,对探索新事物充满热情。
加分项:
- 有大语言模型语料优化和模型训练的实际经验。
- 参加过算法竞赛(如Kaggle、ICPC、ACM等)、信息学、数学、物理、化学竞赛,并取得优异成绩。
- 在顶级国际会议/期刊(如NeurIPS、ICML、ACL、CVPR等)发表过论文。
- 有算法工程化落地经验,有主流开源算法库开发、维护或贡献经历。
岗位标签
NEW
特色标签
Agent、NLP、Python、分布式系统、分布式计算、医疗、发表算法相关优秀论文、图学习、图神经网络、图计算、大数据、大数据分析、大模型、大模型算法、大语言模型、广告、推荐、推荐算法、推荐系统、搜索优化、搜索算法、数据处理、智能代理、机器学习、知识图谱、知识对齐、知识库、知识驱动、算法工程化经验、自然语言处理算法、语义网、语言处理、语言模型、金融、风控算法、风险控制、风险评估