【Plan A】AI工程师-大模型评测-金融垂类-27届
Campus/Intern
Company Antgroup
Focus Tech · Backend
Location 北京, 上海, 杭州
Published August 6, 2026
岗位职责
Ling Team 聚焦百灵模型家族的核心算法创新。基模评测关注的不只是 benchmark 分数本身,而是这些分数能否真实反映:
- 模型的极限深度思考能力,是否被评测方法真正捕捉,而非被表面正确率掩盖;
- 长程推理与规划能力,是否经得起多步骤、跨阶段的严格验证;
- Agentic 执行与真实世界决策的效果,能否被准确、可信地量化;
- 模型能力在工业规模持续训练下的演化趋势,是否能被稳定追踪而不被系统噪声干扰。 在万亿参数与百万亿 token 规模下,评测不再是""训练完之后跑一遍榜""的收尾工作,而是必须与训练系统深度耦合、贯穿预训练全程的核心环节。本岗位将负责构建能够穿透系统噪声、真实反映模型能力演化的评测体系,为架构选型、scaling law 验证与训练策略调整提供第一手判据。我们寻找的不是只会跑评测脚本、看分数涨跌的执行者,而是能理解训练系统内部机制、并从系统视角反推评测方法论设计的核心成员。
任职要求
- 跨团队协作
- 与金融领域研究员深度合作,定义金融行业模型能力的评估体系和模型优化目标。
- 大规模评测体系构建
- 设计支撑万亿参数、百万亿 token 规模训练的评测框架与流水线;
- 结合分布式训练体系(TP / PP / SP / EP / CP),排查评测结果中的系统性噪声与偏差;
- 建立模型能力的定量评估框架,支撑架构 / 超参 / 数据 scaling laws 的验证。
- 评测与训练系统协同
- 深入 Megatron / DeepSpeed / FSDP 等框架底层,理解训练过程对评测结果的潜在影响;
- 结合 CUDA / NCCL 通信优化原理,定位评测流程中的性能瓶颈并推动优化;
- 与系统团队协作,完成评测系统与训练系统的架构级 co-design,确保评测结果的可信度。
- 能力边界的定量刻画
- 从算法目标反推评测指标设计,构建能反映深度思考、长程推理、Agentic 执行等能力的评测方法;
- 对 scaling law 与系统瓶颈保持直觉判断,识别评测数据中的异常信号;
- 支撑 mid-training、能力迁移机制等阶段的效果验证。
- 后训练与强化学习效果评估
- 构建针对 SFT / RLVR / Agentic RL / RLHF / distillation 等后训练范式的评测方案;
- 设计""正确性 × 过程质量 × 信息密度""复合维度下的评测指标体系;
- 评估 reasoning 与 tool-use 协同能力,支撑周级别长程工作能力的验证。
特色标签
AI Agent、C/C++、GPU通信优化、Python、Shell、人类反馈强化学习、保险、信贷、分布式训练、分布式训练框架、千亿级参数、反洗钱、合规、多步推理、大模型基准验证、大模型测评、大模型测试、大模型算法、大模型训练框架、大模型评估、尺度定律、巨参数规模、并行计算、并行训练框架、异构计算通信、强化学习、强化学习微调、扩展律、支付、智能代理、智能体、模型加速/性能优化、深度学习、理财、监督微调、知识蒸馏、算法工程化经验、缩放规律、自主代理、自然语言处理算法、英美留学生、规模法则、超大规模参数、金融、金融专业、金融场景、金融行业、金融领域、银行、长序列推理、长期推理、长链推理、预训练环节、预训练过程、预训练阶段、风控、高性能通信库