蚂蚁集团-AI模型平台技术专家/架构师-杭州/上海

Company Antgroup

Focus Tech · Backend

Location 上海, 杭州

Published September 9, 2026

岗位职责

  1. 负责集团 AI 模型平台核心能力建设,支撑文本或多模态大模型的预训练、后训练、线上推理服务和自动化实验迭代等关键场景。
  2. 面向自动化模型研发、推理和 AutoResearch 类场景,建设模型前后训练、推理、实验编排、结果分析、经验沉淀、策略推荐和下一轮实验规划能力,将模型研发和推理部署流程抽象为高效、稳定、可复用的平台能力。
  3. 参与后训练平台能力建设,支持 SFT、PPO、DPO、GRPO、OPD 等常见后训练算法和实验流程的工程化、平台化和自动化。
  4. 面向重点业务的大模型推理平台建设,打造统一的在线推理服务能力,覆盖文本、多模态等模型类型;建设统一推理网关,支持模型版本管理、灰度发布、流量调度与多租户隔离;持续优化推理吞吐(TPS)和首 token 延迟(TTFT),保障线上服务 SLA。
  5. 负责训练和推理基础设施的架构设计与核心技术攻坚,持续提升任务成功率、资源利用率、训练吞吐、推理性能和平台稳定性。
  6. 与算法、业务团队深度协作,围绕 AutoResearch、模型前后训练和文本/多模态大规模推理等方向,将前沿模型算法、低延迟推理链路和研发流程沉淀为标准化平台能力,推动能力在多业务、多模型场景中复用。

任职要求

  1. 计算机基础扎实,熟悉 Linux、分布式系统、网络、存储、数据库、并发编程和常用算法,具备复杂系统设计和问题排查能力。
  2. 精通 Python/Java/Golang/C++ 至少一门语言,具备良好的工程化实践,能够独立负责平台核心模块设计和落地。
  3. 熟悉 LLM、VLM、Diffusion/Flow Matching 等模型的基本结构、训练范式、数据组织方式、前后训练和评测流程,能够理解算法目标并转化为平台能力。
  4. 熟悉 SFT、PPO、DPO、GRPO、OPD 等常见后训练算法或训练策略,有实际训练、调参、数据构造或平台化落地经验。
  5. 熟悉 PyTorch、SGLang、vLLM 等模型训练与推理生态,具备分布式训练、推理服务部署、吞吐/时延优化、稳定性治理和 GPU 资源效率优化等模型工程经验。
  6. 熟悉 LLM 推理系统核心技术,包括 KV Cache 管理、PagedAttention、量化(INT4/INT8/FP8)、Continuous Batching、Speculative Decoding、Tensor/Pipeline Parallelism 等,有推理服务性能优化和线上稳定性治理经验者优先。
  7. 有多模态模型(VLM/图生视频/语音大模型等)推理服务落地经验,了解多模态输入的预处理 pipeline、异构计算调度与端到端延迟优化;或有大规模推理集群的容量规划、成本优化和 SLA 治理经验。
  8. 具备平台产品意识、技术判断力和跨团队协作能力,能够面向算法研发用户抽象通用能力,建设稳定、易用、可扩展的模型研发平台,并在算法快速演进和工程复杂度之间做出合理架构取舍。

特色标签

C++、C/C++、Golang、Java、Linux开发/部署经验、Python、RLHF中的策略优化、Shell、TensorFlow/PyTorch、vLLM推理系统、云原生、云服务、云计算、云计算经验、人工智能模型平台、低延迟推理服务、偏好建模优化、分布式经验、分布式计算、分布式训练、在线推理服务、基础大模型、基础模型训练、基础设施、多模态模型、多模态算法、大型语言模型、大数据经验、大模型平台、大模型推理服务、大模型算法、对齐训练、并行计算、开源大模型推理引擎、强化学习、强化学习对齐、意图挖掘、指令微调、数据库、数据库开发经验、文本生成、无强化学习的偏好对齐、无监督预训练、智能研发、有监督微调、机器学习算法/工程化经验、架构设计经验、模型加速/性能优化、模型对齐优化、模型研发平台、深度学习、深度学习经验、监督微调、直接偏好优化、研发效能、算法工程化经验、自然语言处理算法、自然语言处理经验、自监督预训练、视觉语言模型、语义理解、跨模态模型、近端策略优化、通用大模型、高性能大模型推理框架