【Plan A】大模型算法工程师-百灵-27届
Campus/Intern
Company Antgroup
Focus Tech · Algorithm
Location 北京, 杭州, 成都
Published May 14, 2026
岗位职责
- 参与高质量、多样化的语料合成能力建设,结合大模型不同阶段的短板及上下游联动构建百灵必须的Deep Research、可视化前端等Agentic语料以及逻辑推理语料,持续提升百灵模型的竞争力; 2.结合模型全链路优化专项能力,站在pre-train、sft、rl多阶段联动的视角,结合不同阶段之间的潜力激发,结合模型能力泛化性的提升,提升专项能力在每个阶段的潜力、推理严谨性、token效率和整体效果;
- 结合不同阶段的语料筛选与rl reward策略,构建基于rubrics结合的语料合成与rl奖励机制,结合语料筛选、指令遵循及agenticrl能力建设,持续提升百灵模型long horizon深度分析及建站能力,提升模型推理的稳定性和一致性; 4.具有卓越的实验分析和实验设计能力,对大模型整体框架和多阶段能力有比较清晰的理解,能够紧跟业界最前沿的进展。工作中,能够敏锐结合模型表现捕获模型能力的不足,针对性的语料构造与实验设计,更高效的解决专项能力中模型能力的不足;
- 有比较好的工程基础,参与算法-工程co-design的相关工程能力建设,结合模型相关能力的建设,敏锐的捕获相关工程效率问题,转化为对代码、训练/推理、数据链路的优化工作,为模型、数据迭代pipeline提效率。
任职要求
- 计算机、人工智能、自动化、数学或相关专业硕士及以上学历; 2.扎实的机器学习与深度学习基础,对强化学习算法理论有充分的了解;
- 具备大模型与 RL 结合的实际项目经验,如preTrain 、SFT、RLHF、DPO微调、智能体训练、模拟环境交互等;
- 熟练掌握 PyTorch 等深度学习框架,熟悉常用大模型训练库; 5.具备优秀的工程实现能力和问题拆解能力,能独立推进端到端算法落地;
- 对 AGI 技术有热情,乐于探索前沿、拥抱不确定性。 加分项: 熟悉多模态大模型+ RL 应用场景; 或有高质量开源项目、顶会论文或知名 AI 实验室研究经历;或在Kaggle、LeetCode、ACM/ICPC等竞赛中有优异成绩。
特色标签
agent-based、Python、人类反馈强化学习、偏好优化、分布式训练、参加算法相关竞赛/获奖、发表算法相关优秀论文、基于人类反馈的强化学习、基础模型、多模态算法、多步推理、大模型算法、大语言模型、奖励建模、并行计算、强化学习、指令微调、无监督预训练、智能体、有监督微调、机器学习、深度分析、深度学习、深度推理、深度研究、生成式人工智能、监督微调、直接偏好优化、策略优化、算法工程化经验、自主智能体、自然语言处理算法、自监督预训练、评估标准、评分准则、评判规范、长序列推理、长程推理、预训练