【Plan A】大模型动态评测与评测诊断方向(AGI蓝军)-27届

Campus

Company Antgroup

Focus Tech · Security

Location 北京, 上海, 杭州

Published August 6, 2026

岗位职责

  1. 面向基座模型、领域模型、应用系统与智能体,研究如何将不断涌现的智能能力转化为可测量、可复现的科学问题。
  2. 依托金融等高复杂度、高可信要求的真实场景,构建随模型与任务共同演进的动态评测与诊断方法,识别能力边界、失效模式及其成因,并将真实世界反馈转化为模型训练与系统演进的信号。

任职要求

  1. 跨团队协作
  • 与金融领域研究员深度合作,定义金融行业模型能力的评估体系和模型优化目标。
  1. 大规模评测体系构建
    • 设计支撑万亿参数、百万亿 token 规模训练的评测框架与流水线;
    • 结合分布式训练体系(TP / PP / SP / EP / CP),排查评测结果中的系统性噪声与偏差;
    • 建立模型能力的定量评估框架,支撑架构 / 超参 / 数据 scaling laws 的验证。
  2. 评测与训练系统协同
    • 深入 Megatron / DeepSpeed / FSDP 等框架底层,理解训练过程对评测结果的潜在影响;
    • 结合 CUDA / NCCL 通信优化原理,定位评测流程中的性能瓶颈并推动优化;
    • 与系统团队协作,完成评测系统与训练系统的架构级 co-design,确保评测结果的可信度。
  3. 能力边界的定量刻画
    • 从算法目标反推评测指标设计,构建能反映深度思考、长程推理、Agentic 执行等能力的评测方法;
    • 对 scaling law 与系统瓶颈保持直觉判断,识别评测数据中的异常信号;
    • 支撑 mid-training、能力迁移机制等阶段的效果验证。
  4. 后训练与强化学习效果评估
    • 构建针对 SFT / RLVR / Agentic RL / RLHF / distillation 等后训练范式的评测方案;
    • 设计""正确性 × 过程质量 × 信息密度""复合维度下的评测指标体系;
    • 评估 reasoning 与 tool-use 协同能力,支撑周级别长程工作能力的验证。

特色标签

Agent、Agentic RL、Agentic系统、C/C++、GPU通信优化、Python、RLHF、RLVR、Shell、TP/PP/SP/EP/CP、交易、保险、信贷、分布式训练、分布式训练框架、参数-数据扩展律、反洗钱、合规、后训练优化、基座模型、大模型算法、大语言模型、定量评估、并行计算、异常信号、强化学习、扩缩律、支付、数据安全、智能代理、模型加速/性能优化、模型并行框架、测试、理财、算子优化、算法工程化经验、能力下降、自然语言处理算法、规模律、训练框架、评估、诊断、超大模型、边界缺陷、金融、金融场景、金融应用、金融级可信、银行、集群训练、风控