岗位职责
- 负责搜广推训练系统的设计、开发和稳定性建设,覆盖离线训练及在线学习场景。
- 深入理解算法用户的训练流程和实际痛点,将业务需求抽象为可复用、可演进的系统能力。
- 负责训练系统与公司内部调度、数据流、存储、模型管理及通用训练平台的集成。
- 负责 TensorFlow、PyTorch,以及 TorchRec、PyTorch Lightning 等相关组件的内部适配和演进。
- 建设训练任务的可观测、智能诊断和故障恢复能力,提升用户自助排障效率。
- 负责训练平台后端及相关工具建设,推动任务提交、运行、诊断和模型产出流程标准化。
- 治理版本碎片化和历史技术债务,推进公共能力复用及系统架构收敛。
- 与算法、数据、调度、存储等团队协作,持续提升训练效率、稳定性和用户体验。
任职要求
- 计算机相关专业本科及以上学历,具备扎实的计算机基础和良好的工程能力,二年以上工作经验。
- 具备后端或系统研发经验,熟悉分布式系统、任务调度、数据处理、存储或可观测性中的一个或多个方向。
- 熟练掌握 Python,并熟悉 Java、C++、Go 中至少一种语言,具备跨语言定位问题的能力。
- 理解机器学习训练的基本流程,使用或维护过 TensorFlow、PyTorch 等训练框架。
- 熟悉 Kubernetes、容器化和分布式任务运行机制,具备线上系统稳定性建设及故障排查经验。
- 能够独立负责复杂系统或核心模块,在保障业务连续性的同时推进技术演进和历史问题治理。
- 具备用户视角、技术产品判断和跨团队推动能力,能够抽象需求并合理判断功能边界、用户价值及长期维护成本。
加分项
- 有搜索、推荐、广告训练或在线学习系统经验。
- 有分布式训练、Embedding、Parameter Server、TorchRec 或大规模稀疏模型经验。
- 有面向算法用户建设训练平台、机器学习平台、数据平台或任务调度平台的经验。
- 有 Elastic Training、Checkpoint、训练节点恢复、故障注入或可观测体系建设经验。
- 有存量系统治理、平台能力收敛、版本治理或用户迁移经验。
- 有使用 AI Coding 完成平台前后端迭代的实践经验。
特色标签
C++、Checkpoint续训、Docker、Golang、Hadoop、Hive、Java、K8s任务编排、Meta深度学习框架、Python、Spark、TF、Torch、云原生、信贷、分布式经验、分布式计算、分布式训练平台、可观测性体系、大数据、大数据经验、实时增量训练、实时模型更新、容错自愈、广告、弹性调度、技术债务清理、推荐、推荐系统专用组件、搜索、搜索/推荐/广告、搜索/推荐/广告经验、搜索推荐广告、支付、数据安全、机器学习训练框架、架构设计经验、流式训练、版本碎片化治理、电商、监控告警、稀疏推荐训练库、系统收敛、营销、训练节点恢复、谷歌深度学习框架、资源调度器、金融、链路追踪、风控