乌鸫科技-大模型应急运维工程师-平台技术Company AlibabaFocus Tech · AlgorithmLocation 杭州Published August 26, 2026岗位职责 负责百炼大模型推理服务全链路的监控体系建设与应急响应,覆盖模型调用链路追踪、推理时延与吞吐监控、Token消耗与限流观测、GPU资源与卡型、推理引擎运行状态监控等核心场景,针对模型服务的限流、超时、OOM、推理性能退化等典型故障,建立快速定位与恢复机制,保障大模型服务的高可用与稳定输出。 负责推动阿里各业务及百炼大模型的的各类业务的监控覆盖与质量优化,定期开展监控验证保鲜,覆盖阿里电商、中间件、ASI、大模型、基础设施等核心链路,针对监控盲区与未发现的风险/故障,从稳定性角度评估观测可行性,设计并推动落地解决方案,持续提升系统的可观测能力。 负责阿里各集团及百炼大模型线上业务的7×24小时oncall、风险、故障应急响应与协同,包括应急事件判断、故障应急启动、应急处置与恢复、进展同步及应急质量复盘,持续沉淀应急经验与预案,提升应急处置的专业度与效率。 负责阿里核心业务 双11等大促活动的稳定性保障,以及大模型业务在流量高峰下的业务重保,参与容量交付、预案准备、压测演练、应急处置与现场护航。 负责分析历史风险与故障案例,设计故障注入方式,复现故障场景,定期执行混沌演练,验证快恢预案的有效性,分析演练结果,提出改进措施,持续优化演练流程,确保核心业务具备分钟级恢复能力。 负责建设自动化应急快恢工具,协助实现具备自主诊断、智能决策、自动处置能力的应急数字人,构建大模型运维诊断助手,缩短故障定位与恢复时间,推动AI时代稳定性保障新范式。 任职要求 计算机相关本科及以上学历,1年以上互联网、云计算、AI Infra方向的运维保障经验,对故障排查、定位、快恢有一定经验积累。 熟悉Linux系统、K8s、Docker等基础设施,掌握网络、存储、计算等常见系统问题的排查手段和恢复措施,具备日志分析、链路追踪等可观测性工具使用经验,了解大模型推理服务调用链路与故障排查者优先。 具备强烈的责任心,做到负责事项有响应、有反馈、有跟进,具有良好的跨团队沟通协调能力,具备良好的问题分析与解决能力,能够独立处理紧急运维事务。 可以适应7×24监控值班(平均每月夜班3次)。 具备较强的学习和自驱能力,持续关注新技术的发展,拓展自己的能力边界。 以下经验者优先:大模型推理服务运维经验;GPU资源管理经验;可观测性体系建设经验;智能运维/AIOps/大模型构建运维Agent的实践经验。