jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

Token Foundry-大模型训练Infra工程师-容器Infra方向

Company Tongyi

Focus Tech · Algorithm

Location 北京, 深圳, 上海

Published August 4, 2026

岗位职责

  1. 基于开源 Kubernetes 构建面向大模型训练的容器化基础设施增强能力,研发 GPU 拓扑感知调度、Gang 调度、资源碎片治理与利用率提升,保障千卡 / 万卡级作业的快速拉起与高吞吐运行。
  2. 研发面向训练作业的任务编排与作业管理能力(作业生命周期管理、作业全链路追踪等自定义控制器),支撑预训练、RL、评测多场景任务的可靠调度与快速恢复。
  3. 建设训练算力的资源效率体系,负责容量规划、资源配额预分配与预检、按水位的动态分配 / 变更 / 释放,治理任务间资源争抢,并解决跨集群 Checkpoint 迁移等人工低效问题。
  4. 建设训练镜像加速(镜像构建、分层与压缩、按需加载、P2P、Region 级缓存与预热)与容器存储 / 网络优化能力,缩短作业启动与数据加载时延。
  5. 负责多集群、多算力池的接入与弹性对接(AI 算力池对接、GPU 多地域弹性),建设环境工程(跨域网络、环境交付、可用性巡检),沉淀可复用平台能力与自动化运维。

任职要求

  1. 计算机、软件工程等相关专业本科及以上学历,2 年以上容器、云原生或大规模基础设施研发经验。
  2. 熟练掌握 Go 语言,具备扎实的 Linux 系统基础(网络栈、文件系统、cgroups、进程管理),有复杂分布式系统的调试与问题定位能力。
  3. 对 Kubernetes 架构有深入理解,熟悉 Controller / Operator / Scheduler 扩展开发与 CRD / API 扩展机制,有自定义调度器或控制器研发经验;了解容器 Runtime(containerd / CRI)原理。
  4. 具备以下至少一个方向的深度实践经验: a. 大规模 GPU 调度与资源效率(拓扑感知、Gang 调度、配额管理,如 Koordinator、Volcano、Kueue 等); b. 训练 / AI 任务编排与作业生命周期管理(Kubeflow Training Operator、JobSet 等); c. 容器镜像加速与分发(Dragonfly、Nydus、Overlaybd 等)或多集群 / 跨域算力接入(Karmada、Cluster API 等)。
  5. 了解大模型训练的资源特征(GPU 拓扑、通信模式、Checkpoint 等),有 AI Infra 相关工程经验者优先。
  6. 良好的工程素养与协作沟通能力,能在快迭代、多团队协作的训练 Infra 场景中稳定交付。

岗位标签

NEW

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.