jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

基础设施与稳定性工程-AI算力资源运营-杭州

Company 阿里巴巴

Focus 技术 · 算法

杭州

July 30, 2026

岗位职责

• 需求对接与方案交付:作为集团AI业务算力需求的核心对接人,深入理解业务场景,将模型部署需求转化为算力规格(TPM、MU等)和SLO性能指标,输出可落地的需求应答和交付方案。协调应用团队、推理引擎团队与SRE团队,组织方案评审、跟进交付进度,确保服务保质保量上线。 • 资源效能分析与治理:建立AI算力资源的效能监控体系,围绕GPU利用率等核心指标进行数据分析,识别资源浪费和瓶颈场景,推动治理方案落地执行。跟踪核心业务推理性能表现,发现偏差时协同引擎团队调优,保障业务侧感知的推理速度与稳定性。 • 服务流程与标准化建设:建立并持续优化集团内部算力服务流程,沉淀标准化的需求受理、方案评审、交付验收规范。结合服务过程中的共性问题,利用AI Agent或自动化工具提升服务效率,沉淀最佳实践。

任职要求

• 技术基础:本科及以上学历,计算机相关专业,或具备软件开发、系统运维、资源运营等技术岗位工作经验,能理解技术架构和基本的系统性能指标。 • AI算力领域经验:有AI行业解决方案、GPU/算力资源管理、推理服务运营、技术支持等相关工作经验。了解大模型(MaaS)业务模式和推理算力基本特性(如Token计费、并发控制等),具备算力成本和容量的估算意识。 • 沟通与项目管理能力:具备极强的跨部门协调能力和对客服务意识,能将模糊的业务需求拆解为清晰的技术指标和执行计划,高效推动多方团队达成共识、解决项目卡点。有项目管理经验者优先。 • 加分项:熟悉GPU资源效能指标体系(利用率、显存占用等);了解vLLM、SGLang等推理引擎基本原理;对AI Agent、skill等大模型应用生态有兴趣或初步实践。

岗位标签

NEW

Apply now

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.