基础设施与稳定性工程-数据研发专家-AI算力数据与智能洞察方向
Company 阿里巴巴
Focus 技术 · 后端
杭州
July 30, 2026
岗位职责
团队介绍 加入AI算力数据与Agent小组,这是直接决定集团AI算力如何被"看见、管好、用好"的核心团队。从每一张GPU卡的产能效率到TPM容量规划、资源交付、供需匹配,实现从资源到售卖的全链路数据打通,并通过数据与Agent驱动的智能洞察支撑MaaS业务增长和管理层经营决策。
方向一:AI算力数据链路建设(数据工程背景) • 建设训练/推理(百炼、通义)两侧TPM与资源数据的采集、治理、建模和指标体系 • 设计标准化数仓,打通资源分配、交付、使用全链路数据口径 • 为MaaS经规管理、财务成本分析、BI、销控系统提供可信数据支撑 • 推动数据Agentic化,让Agent可自动查询、分析和推理算力数据
方向二:算力智能洞察与优化模型(算法工程背景) • 建立TPM容量规划模型与算力画像,支撑供需匹配和弹性交付智能决策 • 构建GPU/CPU/TPM利用率优化算法,实现全局卡型×模型最优匹配 • 开发智能流量管控与限流策略,保障运行时SLA(TTFT、TPOT、错误率) • 结合Agent实现算力优化决策自动化执行闭环
任职要求
1、计算机/数学/统计相关专业本科或硕士及以上,硕士博士优先 2、数据工程:熟练掌握Flink/Spark/Hive/ODPS等,有完整数仓建设或数据治理经验,精通SQL 3、算法工程:具备ML/统计建模/运筹优化基础,有容量规划、资源调度或推荐优化项目经验,Python/Java工程能力扎实 4、了解AI/大模型业务、TPM/GPU算力/推理延迟等核心概念者优先 5、主导过大规模数据体系从0到1建设,或在算力资源调度、容量规划、供需匹配方向有突出成果 6、具备系统架构设计与独立方案落地能力 7、有AI Infra/云计算资源管理/LLM服务平台深度经验者优先 8、能牵引跨团队数据口径共识和联动
加分项 1、熟悉LLM推理/训练系统(vLLM、SGLang、Megatron等) 2、有Agent系统研发或LLM数据工具开发经验 3、资源调度/容量规划/运筹优化方向论文或开源贡献
岗位标签
NEW