【蚂蚁星】大模型评测方向-蚂蚁健康-27届
Campus/Intern
Company Antgroup
Focus Tech · Algorithm
Location 上海, 杭州
Published May 14, 2026
岗位职责
部门介绍: 评测是大模型能力演进的指南针,尤其在严肃的医疗健康等复杂生活场景中,如何定义、度量并指导大模型的能力跃升,是当前AGI领域最核心的未解难题之一。我们致力于探索行业最前沿的大模型评测技术,打破传统静态评测的局限,构建评测-诊断-对齐的自动化闭环,旨在通过科学的评测体系推动通用/医疗垂域大模型突破能力天花板。在这里,你将直接面对业界最具挑战性的复杂推理与高风险场景,你的研究成果不仅能发表在顶会,更将决定亿级用户产品的智能底座高度。
除了前沿课题研究,你将参与到全链路的医疗AGI能力建设,包括:
- 数据理解和质量优化体系:构建行业领先的数据解析和理解能力,不断提升数据处理的深度和理解广度。
- 模型自我迭代闭环:基于大量的线上问题和医院内真实数据,规模化挖掘模型的难负样本,找到模型的提升空间,建设数据的自我迭代反馈闭环。
- 医疗数据合成:设计并落地针对各个能力的大模型的医疗数据合成,生成高质量、可控、多样化的训练样本(包括病例生成、对话模拟、推理链构造等),降低模型幻觉,提升泛化能力。
- 实验分析和归因能力:建立医疗数据的质量评估标准与自动化分析和归因能力,追溯模型输出的数据来源和推理路径,提升医疗AI的可解释性和可信度。
任职要求
- 学术背景:计算机科学、人工智能、统计学、数学等相关领域的顶尖博士(或具备同等科研能力的极优硕士),具备极强的代码落地能力(熟练使用Python及PyTorch等框架);
- 大模型底座认知:深刻理解LLM/Transformer底层架构及后训练范式(SFT, RLHF, DPO, PPO等),对当前业界主流模型(GPT-4, Llama3等)的能力边界与缺陷有深入洞察;
- 顶尖学术成果:在国际顶级AI会议或期刊(如ICLR, NeurIPS, ICML, ACL, EMNLP等)一作或共一;
- 敏锐的研究嗅觉:对AI前沿技术充满狂热的好奇心,能深刻理解大模型评测、Agent架构、RAG体系的典型失败模式,并能独立提出创新性的解决方案;
- 复杂问题解决能力:具备极强的逻辑拆解与数学功底,能建立严谨的统计推断与实验规范(置信区间、显著性检验、多重比较等),确保结论的可信与可解释性。
加分项:
- 开源与竞赛影响力:作为核心贡献者参与过知名开源评测框架/数据集(如HELM, OpenCompass, MMLU, CL-Bench等),或在Kaggle等顶级算法竞赛中获得TOP名次;
- 实战经验:有大厂大模型训练/后训练/对齐方向的实习经验;或具备Reward Model训练与偏好对齐的成功实践;
- 跨学科背景:具备医疗健康、生物信息学相关背景,或对高合规/高安全性AI系统的评测与对齐有研究经验者优先。
特色标签
AI模型评测、Python、人工智能幻觉、人工通用智能、人类反馈强化学习、优秀开源项目经历、偏好优化算法、健康AI、分布式训练、医疗、医疗AI、参加算法相关竞赛/获奖、发表算法相关优秀论文、基于人类反馈的强化学习、大模型、大模型幻觉、大模型算法、大语言模型、大语言模型评测、强化学习、意图挖掘、文本生成、智能医疗、有监督微调、机器学习、检索增强推理、检索增强生成、模型评估、深度学习、监督微调、直接偏好优化、算法工程化经验、编解码器架构、自注意力模型、语义理解、通用人工智能