Company Aliyun
Focus Tech · Full Stack
Location 济南, 青岛, 北京
Published August 11, 2026
2年以上泛娱乐、零售、金融、教育等行业大型互联网应用(含AI原生应用)或集团型企业应用的研发、架构设计、监控方案、Devops、AIops、维护、高可用改造方案经验。
熟悉Agent开发框架及工具(LangChain/Dify/LlamaIndex/百炼等),模型推理框架(vLLM /sglang),模型训练框架(LlamaFactory、swift等),具备GPU集群调度、资源隔离、显存优化相关经验,能够解决大规模算力下的性能瓶颈与稳定性问题。
熟悉主流大模型推理框架(如 vLLM, Triton Inference Server, TensorRT-LLM, TGI 等)。
了解 NVIDIA GPU 底层架构及分布式通信机制(如 NVLink, NCCL, RDMA/RoCE 高速网络)。
熟悉JAVA、Python、GO其中一门开发语言,熟悉常见中间件、数据库、大数据组件,如Redis、Nacos、K8s、Kafka、spark、flink等,具有2年以上软件开发经验优先。
具备大模型、云原生、大数据、数据库、网络、中间件等领域中的一项或多项技术理解和应用经验,有阿里云公共云产品相关使用运维经验优先。
熟悉云原生的系统架构设计方法,有应用与数据迁移改造方案设计实施经验优先。
具有优秀的沟通技巧、团队合作经验、敬业精神和学习能力。
具有较强的抗压能力和执行力,并能接受一定频率的出差。 加分项:
有ACP(阿里云认证工程师)、ACE(阿里云认证高级工程师)者优先。
熟悉阿里云 AI 产品矩阵(如 PAI 机器学习平台、百炼大模型平台)或具有相关云厂商 AI 基础设施研发经验。
对大语言模型(LLM)的量化(AWQ/GPTQ)、KV Cache 优化(如 PagedAttention)有一定了解。
具备极强的复杂问题排查能力,有处理过 GPU OOM、CUDA/算子报错、NCCL 通信超时或死锁等 AI 典型故障的实战经验者优先。