jdwatch
  • Home
  • CLI
  • Skills
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

阿里云智能-全栈技术服务工程师-AI全栈-北京/青岛/济南

Company Aliyun

Focus Tech · Full Stack

Location 济南, 青岛, 北京

Published August 11, 2026

岗位职责

  1. 企业级 AI Agent 工程落地指导:作为客户 AI 应用技术服务的第一责任人,深入理解客户业务场景与技术痛点,主导Agent等工程全链路落地服务:从 RAG 构建、知识库向量化、Prompt Engineering 调优,到多 Agent 协作编排、工具链集成与 Function Call调试,确保 AI Agent 在生产环境高效运行。
  2. 大模型训练与推理全链路架构设计,负责从数据到模型端到端技术支持:数据侧:设计数据采集、清洗、标注流程,搭建高质量训练数据 Pipeline;训练侧:基于 PAI 平台进行模型微调(SFT/RLHF)、LoRA 适配、分布式训练集群调度;推理侧:优化推理性能(KV Cache、Flash Attention)、推理服务弹性伸缩、Tokens成本治理。
  3. AI 云原生稳定性保障: 从客户架构视角出发,通过自动化巡检、AIOps 工具链推动问题主动发现与风险预防。构建 AI 云原生全链路可观测体系,覆盖 SaaS 层(百炼/通义)、PaaS 层(PAI/DashScope)、IaaS 层(GPU 实例/高速网络)。结合大模型业务的高并发、长文本等流量特征,制定 GPU 算力集群的弹性扩缩容策略。负责推理延迟优化、显存 OOM 治理、模型服务灰度发布、模型流量调度、算力混沌工程、故障快速定位与 RCA 沉淀。
  4. 卓越架构护航从公共云企业客户的业务视角出发,基于云上卓越架构最佳实践,主导客户云系统的持续诊断与重构。围绕高性能、高可用、安全合规、运维提效与成本精细化管理五大维度,推动架构的标准化与现代化升级。攻坚 AI 基础设施与传统业务系统的异构集成难题。设计并落地云上弹性伸缩方案,确保大模型/AI 业务在云端环境下的无缝对接、平滑扩缩容与极致弹性。

任职要求

  1. 2年以上泛娱乐、零售、金融、教育等行业大型互联网应用(含AI原生应用)或集团型企业应用的研发、架构设计、监控方案、Devops、AIops、维护、高可用改造方案经验。

  2. 熟悉Agent开发框架及工具(LangChain/Dify/LlamaIndex/百炼等),模型推理框架(vLLM /sglang),模型训练框架(LlamaFactory、swift等),具备GPU集群调度、资源隔离、显存优化相关经验,能够解决大规模算力下的性能瓶颈与稳定性问题。

  3. 熟悉主流大模型推理框架(如 vLLM, Triton Inference Server, TensorRT-LLM, TGI 等)。

  4. 了解 NVIDIA GPU 底层架构及分布式通信机制(如 NVLink, NCCL, RDMA/RoCE 高速网络)。

  5. 熟悉JAVA、Python、GO其中一门开发语言,熟悉常见中间件、数据库、大数据组件,如Redis、Nacos、K8s、Kafka、spark、flink等,具有2年以上软件开发经验优先。

  6. 具备大模型、云原生、大数据、数据库、网络、中间件等领域中的一项或多项技术理解和应用经验,有阿里云公共云产品相关使用运维经验优先。

  7. 熟悉云原生的系统架构设计方法,有应用与数据迁移改造方案设计实施经验优先。

  8. 具有优秀的沟通技巧、团队合作经验、敬业精神和学习能力。

  9. 具有较强的抗压能力和执行力,并能接受一定频率的出差。 加分项:

  10. 有ACP(阿里云认证工程师)、ACE(阿里云认证高级工程师)者优先。

  11. 熟悉阿里云 AI 产品矩阵(如 PAI 机器学习平台、百炼大模型平台)或具有相关云厂商 AI 基础设施研发经验。

  12. 对大语言模型(LLM)的量化(AWQ/GPTQ)、KV Cache 优化(如 PagedAttention)有一定了解。

  13. 具备极强的复杂问题排查能力,有处理过 GPU OOM、CUDA/算子报错、NCCL 通信超时或死锁等 AI 典型故障的实战经验者优先。