乌鸫科技-大模型训练推理技术支持工程师-GOCCompany AlibabaFocus Tech · AlgorithmLocation 杭州Published August 11, 2026岗位职责 负责阿里集团业务、大模型训练/推理平台、中间件及基础设施的故障全生命周期管理,覆盖故障预防、发现、响应、复盘闭环,推动稳定性目标与度量体系(SLI/SLO)设计及风险洞察运营。 深入大模型训练与推理研发全周期,前置识别稳定性与运维风险;参与训练/推理架构评审(如 PD 分离、KV Cache 管理、多机推理等),推动可观测、容量、容灾及故障隔离能力建设,规范变更三板斧,建立强弱管控机制。 作为业务团队协同枢纽,对内联动研发、测试、SRE、产品等角色推进重点目标,对外面向商业化前线 TAM 提供统一技术接口,降低对研发的资源消耗,为重保客户提供稳定性支持。 负责双 11、618 等大促及大模型业务高峰期的稳定性保障,参与活动稳定性管理、应急协同及现场护航。 负责集团稳定性机制与文化运营,制定并运营故障应急、变更管控、发布审批、应急演练等标准流程,沉淀 FAQ、Runbook、故障案例库,推动个人经验转化为组织资产。 负责建设故障 AI 分析工具,设计故障标签体系、自动化打标、智能解析与深度解读,探索 AI 时代故障管理新范式。 任职要求 计算机及相关专业本科及以上学历,1 年以上互联网、云计算、AI Infra、MaaS 方向运维经验,熟悉 Java/C++/Python 等至少一门编程语言。 具备复杂业务场景下流程优化、过程改进、高可用架构落地及组织稳定性意识提升的实战经验。 逻辑清晰、思维全局,能提出有创造性的问题分析与解决方案。 责任心强,事事有响应、有反馈、有跟进;沟通表达优秀,具备良好的团队合作与跨团队协同能力。 学习自驱力强,持续关注新技术,能并行处理多任务,抗压能力强。 有大模型训练/推理服务运维经验,或智能运维工具实践经验者优先。