【蚂蚁星】算法工程师-LLM后训练-灵光(实习)
Company Antgroup
Focus Tech · Algorithm
Location 杭州
Published May 12, 2026
岗位职责
部门介绍: 灵光APP是一款原生多模态的AGI助手,团队致力于构建有竞争力的AGI产品体验。算法团队以用户体验为牵引,为灵光助手构建后训练体系和模型。驱动灵光在智能体验上保持业界领先。 职位描述: 1.参与设计并实现 代码生成(可视化方向)、Agent等方向的大模型后训练算法; 2.结合业务数据和场景,设计Post training的高质量数据构建方案(含数据洞察、数据合成、数据质量优化等)提升模型的应用效果; 3.与工程以及产运团队协作,参与或负责大语言模型、多模态大模型等业务场景的后训练端到端效果提升及落地; 4.密切关注业界 LLM 微调算法和数据提质领域的前沿论文,并整合新技术和算法到训练引擎中,提升框架的领先性。
任职要求
1.在后训练微调领域拥有丰富的项目经验,熟恶DPO、PPO、GRPO、OPSD等算法原理,具备扎实的数学基础,熟悉线性代数、概率统计、优化算法等。; 2.对Megatron-LM、DeepSpeed等分布式框架及LLaMA-Factory、ms-swift等大模型微调工具库有一定的了解或相关开发经验; 3.具备优秀的算法研发能力,对LLM领域前沿技术有热情,能够自驱地设计丰富的实验并完成论文技术的落地验证; 4.拥有良好的沟通表达能力和团队协作精神,具有强烈的责任心和使命感。 加分项: 1.在顶级会议或期刊上发表过相关研究论文; 2.拥有LLM领域大规模数据处理经验; 3.在后训练微调引擎方面具有实战经验; 4.有代码大模型的调优经验。
特色标签
AI Agent、CodeGen、Direct Preference Optimization、LLaMA微调工具、LLM微调、Megatron框架、MM-LLM、Python、Shell、Swift微调库、代码合成、代码自动生成、偏好优化算法、内容、内容安全、再训练、分布式训练、分布式训练加速框架、分布式训练框架、发表算法相关优秀论文、合规、后训练、多模态模型、多模态算法、大模型微调、大模型微调库、大模型算法、强化学习、微调阶段、微软DeepSpeed、微软微调工具、支付、数据安全、智能代理、智能体、智能研发、有留学背景、模型加速/性能优化、模型精调、深度学习、研发效能、算法工程化经验、聊天机器人、自然语言处理算法、跨模态大模型、金融