jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

Token Foundry-大模型训练Infra工程师-训练稳定性方向

Company Tongyi

Focus Tech · Algorithm

Location 北京, 深圳, 杭州

Published August 4, 2026

岗位职责

  1. 建设超大规模训练的稳定性治理体系,围绕有效训练时长(ETTR)与 Goodput 做端到端度量与优化,量化并持续压缩因故障、回滚、启动带来的无效算力(Badput)。
  2. 构建覆盖软硬件异常的故障可观测能力,完善日志、指标、事件的采集与关联分析;研发智能诊断能力,实现训练 slow / hang / OOM / 通信异常等故障的快速定界与根因追溯,沉淀故障模式库与自动诊断规则。
  3. 研发自动容错与快速恢复机制,支持断点续训、Pod 级快速重启、节点自动自愈、动态降级与局部重试;优化 failover、本地盘 / 缓存与 Checkpoint 恢复链路,缩短故障恢复时延。
  4. 建设节点健康度评估与主动巡检体系,覆盖 GPU、网络、存储等软硬件健康,实现故障节点的快速隔离与自愈;支持 Ray 等分布式框架下的作业级故障感知与处理。
  5. 与算法及框架团队协同保障训练全生命周期稳定交付,沉淀可复用的稳定性平台能力,推动变更灰度与自动化运维。

任职要求

  1. 计算机、电子、自动化等相关专业本科及以上学历,2 年以上分布式系统或大规模基础设施研发经验。
  2. 扎实的分布式系统与 Linux 基础,熟悉常用性能与故障诊断工具(nvidia-smi、nsight、perf、py-spy、gdb、strace 等),有较强的疑难问题定位能力。
  3. 具备以下至少一个方向的深度实践经验: a. 大规模分布式作业的容错与自愈系统(故障检测、断点续训、快速重启、failover、Checkpoint 恢复优化,类比 DLRover 等开源项目); b. 大规模系统可观测与智能诊断(日志 / 指标 / 事件关联分析、根因定位、异常检测); c. 节点健康度评估、硬件故障诊断或 SRE / 稳定性工程体系建设。
  4. 了解大模型训练 / RL 的基本流程与常见故障模式(slow、hang、OOM、NCCL 通信异常等),了解 PyTorch、Ray 等框架的运行机制;具备良好的问题抽象与系统设计能力。
  5. 良好的工程素养与跨团队协作能力,能在高强度、快迭代的大模型训练场景中稳定交付。

岗位标签

NEW

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.