Token Foundry-大模型训练Infra工程师-训练稳定性方向
Company Tongyi
Focus Tech · Algorithm
Location 北京, 深圳, 杭州
Published August 4, 2026
岗位职责
- 建设超大规模训练的稳定性治理体系,围绕有效训练时长(ETTR)与 Goodput 做端到端度量与优化,量化并持续压缩因故障、回滚、启动带来的无效算力(Badput)。
- 构建覆盖软硬件异常的故障可观测能力,完善日志、指标、事件的采集与关联分析;研发智能诊断能力,实现训练 slow / hang / OOM / 通信异常等故障的快速定界与根因追溯,沉淀故障模式库与自动诊断规则。
- 研发自动容错与快速恢复机制,支持断点续训、Pod 级快速重启、节点自动自愈、动态降级与局部重试;优化 failover、本地盘 / 缓存与 Checkpoint 恢复链路,缩短故障恢复时延。
- 建设节点健康度评估与主动巡检体系,覆盖 GPU、网络、存储等软硬件健康,实现故障节点的快速隔离与自愈;支持 Ray 等分布式框架下的作业级故障感知与处理。
- 与算法及框架团队协同保障训练全生命周期稳定交付,沉淀可复用的稳定性平台能力,推动变更灰度与自动化运维。
任职要求
- 计算机、电子、自动化等相关专业本科及以上学历,2 年以上分布式系统或大规模基础设施研发经验。
- 扎实的分布式系统与 Linux 基础,熟悉常用性能与故障诊断工具(nvidia-smi、nsight、perf、py-spy、gdb、strace 等),有较强的疑难问题定位能力。
- 具备以下至少一个方向的深度实践经验: a. 大规模分布式作业的容错与自愈系统(故障检测、断点续训、快速重启、failover、Checkpoint 恢复优化,类比 DLRover 等开源项目); b. 大规模系统可观测与智能诊断(日志 / 指标 / 事件关联分析、根因定位、异常检测); c. 节点健康度评估、硬件故障诊断或 SRE / 稳定性工程体系建设。
- 了解大模型训练 / RL 的基本流程与常见故障模式(slow、hang、OOM、NCCL 通信异常等),了解 PyTorch、Ray 等框架的运行机制;具备良好的问题抽象与系统设计能力。
- 良好的工程素养与跨团队协作能力,能在高强度、快迭代的大模型训练场景中稳定交付。
岗位标签
NEW