岗位职责
- 保障AI服务稳定性: 覆盖大模型训练以及后训练、AI Agent、模型推理部署与性能、评测环境、安全沙箱等全链路以及相关平台,构建预警、定位、自愈、降级等核心可靠性能力,负责全站全生命周期应急工作;
- 构建资源治理与成本优化体系: 面向算力使用,落地资源配额、极致的训推资源调度效率提升与优先级管理,成本归因及优化方案,保障AI业务规模化下的经济可持续运营。
- 探索AI驱动的智能化运维: 将AIOps与AI Agent融入稳定性工作,建设异常检测、质量退化识别等智能运维能力,共同探索运维harness架构,用AI保障AI的运行可靠性。
任职要求
- 必备项:
- 工程能力扎实,熟悉AI技术栈,精通Python/Golang/Java至少一种。
- 二选一,熟悉推理服务架构(vLLM/SGLang/tensorRT/Triton等)或Agent执行链路/熟悉训练服务架构,了解大模型训练基础理论和常用训练框架。
- 熟练掌握大模型相关基础知识,如Transformers架构、Attention、GPU与计算基础(cuda、pcie、nccl)、云原生与资源调度等。
- 基于ROI为AGI稳定性承担端到端责任。
- 加分项:
- AI推理/训练服务及相关平台稳定性保障或SLO建设落地经验。
- 具有AI公司应用层稳定性相关工作经历,或SRE/可靠性领域开源贡献。
- 具备AI Infra研发或算子优化、模型量化工作经验优先。
- 具备大模型推理性能调优经验、sglang等主流社区有效PR经历者优先。
特色标签
AI智能体、AI算力、AI运维、Docker、Foundation Model、Golang、GPU算力、Java、K8s、Kubernetes、LLM、Python、SRE、不限、云原生、人工智能运维、人工通用智能、分布式训练、可靠性、可靠性工程师、在线推理、基础设施、大模型训练、大语言模型、容器化、容灾、推理部署、智能代理、智能体、智能运维、模型推理、模型预训练、熟悉Linux/Unix系统、稳定性工程师、站点可靠性工程、计算资源、运维开发/DevOps、运维开发经验、通用人工智能、高可用