蚂蚁集团-大模型应用算法(自动化评测与benchmark)-健康事业群
Company Antgroup
Focus Tech · Algorithm
Location 上海, 杭州
Published August 5, 2026
岗位职责
职位概述 探索行业前沿的大模型技术,建立科学、全面的评测体系,支持模型演进、产品落地、竞对分析评估,通过自动化归因等方案反馈优化模型算法与系统。 核心工作 1)高质量Benchmark 建设 构建高区分度评测集:针对医疗多专科、复杂对话决策、长链路推理、记忆/一致性、工具使用、RAG 证据依赖等难点设计专项集。 负责评测数据全流程治理,建立数据泄露/污染检测机制,防止评测虚高。 推动“可持续评测”:小样本高敏感集 + 大样本回归集的组合,支撑日常迭代与版本回归。 2)自动化评测框架与裁判模型 建设 设计并落地自动评测框架:支持规则/打分 Rubric、程序化评估(如工具调用/代码)、以及 LLM-as-a-Judge 混合评测,保证高吞吐、低成本、强复现。 构建评测流水线,必要时训练/微调裁判模型或 reward model,用于特定医疗任务下的稳定评判与偏差控制。 3)效果诊断与后训练闭环 系统化归因:针对指令遵循失败、知识缺失/遗忘、逻辑断裂、证据不一致、幻觉模式、拒答策略不当、工具调用失败等,形成可行动的归因方案。 将诊断结论转化为训练策略:SFT 数据补齐、偏好数据/对比数据构造、DPO/RLHF 奖励设计、课程学习与难度采样等,推动模型持续提升。 建立线上/离线一致性验证:离线评测与线上关键指标(安全风险、满意度、转化等)关联分析,持续校准评测有效性。 4)评测体系与指标方法论 建设 设计并迭代覆盖多维能力的评测体系:通用能力、医疗专业能力、安全合规及稳健性等。 建立可对标的指标体系与实验规范:采样策略、置信区间、显著性检验、多重比较校正等,确保评测结论可信、可复验、可解释。 输出高信度评测报告:不仅给分数,更给差距来源、风险等级、上线门槛与下一步改进优先级。 5)前沿评测研究与复杂场景评估 设计 跟进并复现业界评测与框架:HELM、lm-evaluation-harness 等;对标 MMLU、GSM8K、HumanEval/MBPP、C-Eval/CMMLU、AGIEval 等,形成内部可持续对标体系。 探索复杂场景评测:Agent 多步任务成功率、RAG 的证据忠实性与引用正确性、长上下文一致性、跨轮对话稳定性等,并推动工程化落地。
任职要求
1)计算机/数学/统计/AI 相关专业本科及以上,硕士/博士优先。 2)扎实的算法与工程能力:熟练 Python,能独立完成评测框架开发、数据处理与分析。 3)深刻理解 LLM/Transformer 及后训练范式:SFT、RLHF/DPO/Reward Modeling 等;理解 Agent/RAG 的典型失败模式与评测要点。 4)有大模型评测/后训练经验:大模型评测、后训练、A/B 实验、统计推断等方向有实战沉淀。 5)熟悉或有经验构建/使用主流评测集与框架者优先:C-Eval、CMMLU、HumanEval、AGIEval,或 HELM、lm-evaluation-harness 等。 6)有医疗/合规/安全相关经验加分;有大厂大模型算法/评测/平台化经验加分;发表过顶会论文(ICLR/NeurIPS/ACL等)优先。
岗位标签
NEW
特色标签
AI、C++、CI/CD、Golang、Java、Jira、LLM、MySQL、PHP、Python、Selenium、TestNG、人工智能、医疗、医疗业务、医疗场景、可靠性、多模态交互、多模态处理、大语言模型、定制化、持续交付、数据分析、智能体、测试工具、特征工程、用户定制、算法工程、算法链路、计算机相关专业、质量保障、高品质稳定性