Token Foundry-大模型训练Infra工程师-容器Infra方向
Company Tongyi
Focus Tech · Algorithm
Location 北京, 深圳, 上海
Published August 4, 2026
岗位职责
- 基于开源 Kubernetes 构建面向大模型训练的容器化基础设施增强能力,研发 GPU 拓扑感知调度、Gang 调度、资源碎片治理与利用率提升,保障千卡 / 万卡级作业的快速拉起与高吞吐运行。
- 研发面向训练作业的任务编排与作业管理能力(作业生命周期管理、作业全链路追踪等自定义控制器),支撑预训练、RL、评测多场景任务的可靠调度与快速恢复。
- 建设训练算力的资源效率体系,负责容量规划、资源配额预分配与预检、按水位的动态分配 / 变更 / 释放,治理任务间资源争抢,并解决跨集群 Checkpoint 迁移等人工低效问题。
- 建设训练镜像加速(镜像构建、分层与压缩、按需加载、P2P、Region 级缓存与预热)与容器存储 / 网络优化能力,缩短作业启动与数据加载时延。
- 负责多集群、多算力池的接入与弹性对接(AI 算力池对接、GPU 多地域弹性),建设环境工程(跨域网络、环境交付、可用性巡检),沉淀可复用平台能力与自动化运维。
任职要求
- 计算机、软件工程等相关专业本科及以上学历,2 年以上容器、云原生或大规模基础设施研发经验。
- 熟练掌握 Go 语言,具备扎实的 Linux 系统基础(网络栈、文件系统、cgroups、进程管理),有复杂分布式系统的调试与问题定位能力。
- 对 Kubernetes 架构有深入理解,熟悉 Controller / Operator / Scheduler 扩展开发与 CRD / API 扩展机制,有自定义调度器或控制器研发经验;了解容器 Runtime(containerd / CRI)原理。
- 具备以下至少一个方向的深度实践经验: a. 大规模 GPU 调度与资源效率(拓扑感知、Gang 调度、配额管理,如 Koordinator、Volcano、Kueue 等); b. 训练 / AI 任务编排与作业生命周期管理(Kubeflow Training Operator、JobSet 等); c. 容器镜像加速与分发(Dragonfly、Nydus、Overlaybd 等)或多集群 / 跨域算力接入(Karmada、Cluster API 等)。
- 了解大模型训练的资源特征(GPU 拓扑、通信模式、Checkpoint 等),有 AI Infra 相关工程经验者优先。
- 良好的工程素养与协作沟通能力,能在快迭代、多团队协作的训练 Infra 场景中稳定交付。
岗位标签
NEW