基础设施与稳定性工程-数据研发专家-AI算力数据与智能洞察方向
Company Alibaba
Focus Tech · Backend
Location 杭州
Published September 7, 2026
岗位职责
团队介绍 加入AI算力数据与Agent小组,这是直接决定集团AI算力如何被"看见、管好、用好"的核心团队。从每一张GPU卡的产能效率到TPM容量规划、资源交付、供需匹配,实现从资源到售卖的全链路数据打通,并通过数据与Agent驱动的智能洞察支撑MaaS业务增长和管理层经营决策。
方向一:AI算力数据链路建设(数据工程背景)
- 建设训练/推理(百炼、通义)两侧TPM与资源数据的采集、治理、建模和指标体系
- 设计标准化数仓,打通资源分配、交付、使用全链路数据口径
- 为MaaS经规管理、财务成本分析、BI、销控系统提供可信数据支撑
- 推动数据Agentic化,让Agent可自动查询、分析和推理算力数据
方向二:算力智能洞察与优化模型(算法工程背景)
- 建立TPM容量规划模型与算力画像,支撑供需匹配和弹性交付智能决策
- 构建GPU/CPU/TPM利用率优化算法,实现全局卡型×模型最优匹配
- 开发智能流量管控与限流策略,保障运行时SLA(TTFT、TPOT、错误率)
- 结合Agent实现算力优化决策自动化执行闭环
任职要求
-
计算机/数学/统计相关专业本科或硕士及以上,硕士博士优先
-
数据工程:熟练掌握Flink/Spark/Hive/ODPS等,有完整数仓建设或数据治理经验,精通SQL
-
算法工程:具备ML/统计建模/运筹优化基础,有容量规划、资源调度或推荐优化项目经验,Python/Java工程能力扎实
-
了解AI/大模型业务、TPM/GPU算力/推理延迟等核心概念者优先
-
主导过大规模数据体系从0到1建设,或在算力资源调度、容量规划、供需匹配方向有突出成果
-
具备系统架构设计与独立方案落地能力
-
有AI Infra/云计算资源管理/LLM服务平台深度经验者优先
-
能牵引跨团队数据口径共识和联动
加分项
-
熟悉LLM推理/训练系统(vLLM、SGLang、Megatron等)
-
有Agent系统研发或LLM数据工具开发经验
-
资源调度/容量规划/运筹优化方向论文或开源贡献