大模型AI Infra平台研发工程师(J105494)
Company Baidu
Focus Tech · Algorithm
Location 北京
Published September 14, 2026
岗位职责
- 参与超大规模的AI Infra平台架构设计与研发,统一承载预训练、Midtrain、SFT、RL 场景,打通数据版本、代码、镜像、配置、资源与产物,实现全程可观测、可追踪。统一训练指标、系统指标、日志、资源与评估结果视图,支撑实验归因、故障归因、性能与成本分析
- 基于 Kubernetes、Ray 等技术栈,设计大规模异构资源调度体系,提供拓扑感知、配额抢占、细粒度容错、弹性扩缩容、长任务恢复、异常对账、灰度回滚等能力,保障超大规模训练任务稳定运行
- 建设 Agent 友好的 API 与工作流,统一自然语言、表单、YAML、CLI 的实验与执行语义;探索参数补全、任务编排、故障诊断与受约束自动化实验迭代
- 独立完成复杂问题拆解、方案设计、上线验证与复盘改进,推动多团队达成接口、排期与验收共识,识别架构演进与技术债风险并沉淀工程机制
任职要求
- 本科及以上学历,计算机、软件工程、人工智能或相关专业;3 年及以上分布式系统、云原生平台、AI Infra 或大模型训练平台研发经验
- 熟练掌握 Go、Python、C++、Java 中至少一种语言,能独立完成生产级系统的设计、编码、测试、上线与运维
- 具备在大数据处理系统Ray/Spark、分布式系统Kubernetes上构建AI平台的经验
- 对大模型一站式实验平台(MLOps/LLMOps)平台建设有深入了解,掌握数据版本管理、实验追踪、模型中心、推理部署、模型评估等模块的技术细节
- 具备 Agent 工具调用、MCP/Skill、长期任务状态、评估与回放、Memory 或 Auto Research 相关实践经验
- 具备较强的抽象与系统设计能力,能从用户目标出发定义对象、边界、接口与验收指标;具备良好的 Ownership 与跨团队推动能力,自驱力强,敢于攻坚复杂系统问题
部门/组织
强化学习基建组