蚂蚁集团-百灵语言模型-算法工程师(Deep Research方向)-北京/杭州

Company Antgroup

Focus Tech · Algorithm

Location 北京, 杭州

Published July 14, 2026

岗位职责

我们正在寻找对大语言模型基模训练优化有浓厚兴趣和扎实经验的算法工程师,共同推动下一代智能体(Agent)和通用人工智能(AGI)技术的落地。

主要职责:

  • 参与蚂蚁自研大语言模型各阶段训练,包括但不限于pretrain、SFT、 PPO、DPO、GRPO等
  • 针语DeepResearch类任务的轨迹优化等问题对优化奖励建模、偏好学习及策略微调流程;
  • 探索大模型在复杂任务中的自主推理、工具调用与长期规划能力,结合 RL 提升智能体决策水平;
  • 与数据、工程、产品团队紧密协作,将算法成果高效集成到线上大模型服务中;
  • 跟踪并复现国际顶级会议在 LLM 领域的最新进展。

任职要求

  1. 计算机、人工智能、自动化、数学或相关专业硕士及以上学历; 2. 扎实的机器学习与深度学习基础,对强化学习算法理论有充分的了解。 3. 具备大模型与 RL 结合的实际项目经验,如preTrain 、SFT、RLHF、DPO 微调、智能体训练、模拟环境交互等; 4. 熟练掌握 PyTorch 等深度学习框架,熟悉常用大模型训练库; 5. 具备优秀的工程实现能力和问题拆解能力,能独立推进端到端算法落地; 6. 对 AGI 技术有热情,乐于探索前沿、拥抱不确定性。

加分项:

  • 熟悉多模态大模型 + RL 应用场景;
  • 有高质量开源项目、顶会论文或知名 AI 实验室研究经历;
  • 有分布式训练、大规模 GPU 集群调优经验;
  • 参与过对话系统、游戏 AI、机器人决策等 RL 落地项目;

我们提供:

  • 充足的算力资源
  • 开放、务实、追求技术极致的团队文化

特色标签

Python、RL、云计算、优秀开源项目经历、偏好建模、分布式训练、发表算法相关优秀论文、回报建模、多模态算法、大模型、大模型算法、奖励函数设计、广义强化策略优化、强化学习、意图挖掘、文本生成、智能交互、智能体、机器学习、模型加速/性能优化、深度学习、监督微调、直接偏好优化、策略优化、算法工程化经验、聊天机器人、语义理解、语言模型、近端策略优化、金融、预训练