阿里控股-大模型算法工程师/算法专家-杭州InactiveCompany AlibabaFocus Tech · AlgorithmLocation 杭州Published August 20, 2026岗位职责 负责基础及垂域大模型(LLM、多模态/全模态、语音音频、视觉生成、世界模型等)的算法研发,覆盖预训练、后训练(SFT/RLHF/RLVR)与对齐优化,持续提升模型在推理、指令遵循、多模态理解与生成等核心维度的能力上限。 负责强化学习与Agent技术体系建设,包括Agentic RL训练方案、Reward System与Verifier/Rubric设计、Agent运行环境与Harness、Memory、Skill及多Agent协作机制,提升复杂长程任务的完成质量与鲁棒性。 负责训练与评测数据体系建设,开展高质量数据挖掘、清洗、合成、去重与配比,搭建自动化评测与LLM-as-Judge体系,形成「数据→训练→评测→反馈」的闭环数据飞轮。 推动算法在真实业务场景落地,覆盖搜索推荐与RAG问答、内容与行为安全风控、广告营销与AIGC创意、医疗健康、办公协同、具身智能、AI Coding等方向,端到端完成从问题建模到上线迭代并持续优化业务指标。 负责模型与系统效率优化及技术影响力建设,包括蒸馏、量化、推理加速与端侧部署、大规模分布式训练与训推系统优化,同时跟踪前沿进展并产出论文、专利与开源成果。 任职要求 计算机科学、人工智能、机器学习、数学等相关专业硕士及以上学历(部分岗位本科及以上),博士优先;具备1年以上(主流为3年以上)大模型或机器学习算法研发经验。 扎实的机器学习与深度学习基础,熟悉Transformer、MoE、扩散模型等主流架构;精通Python(熟悉C/C++、Java者优先),熟练使用PyTorch/TensorFlow及主流训练与推理框架(Megatron、DeepSpeed、verl、vLLM、SGLang等)。 在以下方向至少一项具备完整研究或工业落地经验:大模型预训练与后训练(SFT/RLHF/DPO/PPO/GRPO/蒸馏)、多模态理解与生成、Agent与强化学习、模型评测与Reward建模、检索召回与排序、AI Infra与推理优化。 具备端到端闭环交付能力,能独立完成问题定义、数据构建、模型训练、评测迭代到线上部署,并在效果、性能、成本与延迟之间做出合理权衡。 对前沿技术保持敏感度并有强自驱力,在NeurIPS、ICML、ICLR、ACL、CVPR等顶会发表论文、有知名开源项目贡献或ACM等算法竞赛获奖者优先;具备良好的业务理解力与跨团队沟通协作能力。 岗位标签 NEW