AI Infra 研发专家
Company 网易
Focus 技术 · 算法
广州
July 1, 2026
岗位职责
1.构建企业级云原生机器学习平台,支持模型开发、训练、部署的全生命周期管理 2.参与核心技术组件研发,包括分布式训练调度、模型版本管理、模型服务化与推理优化 3.建立 GPU 算力精细化运营体系,通过异构计算调度、弹性伸缩等手段降低大模型训练与推理成本 4.建立完善的监控告警体系,确保系统高可用性和安全性 5,与算法团队、业务团队深度协作,理解需求并提供技术解决方案
任职要求
- 有大规模K8s集群管理经验,熟悉容器技术、服务网格和云原生CI/CD工具链。
- 熟悉主流机器学习框架(TensorFlow/PyTorch),深入理解分布式训练原理(数据并行、模型并行)。
- 有MLOps平台构建经验,熟悉Kubeflow、MLflow、Ray等工具,了解模型优化技术。
- 深入理解GPU工作原理和调度机制,熟悉NVIDIA GPU架构,有GPU集群管理和资源调度经验。
- 熟练掌握 Python/Go,具备优秀的分布式系统设计能力。熟悉高性能网络(RDMA/InfiniBand)或高性能存储者优先。
- 熟悉 LangChain, LlamaIndex, AutoGPT 等框架原理,具备实战经验优先。
- 持续关注 GenAI 领域前沿技术(如 MoE 架构、长上下文优化),有 HuggingFace 开源社区贡献经验者优先。
- 具备优秀的沟通协调能力和抗压能力,有团队管理经验更佳。