研究型实习生-面向多Agent协作Pipeline的评估-诊断-进化闭环研究
Company Antgroup
Focus Tech · Other
Location 上海
Published May 20, 2026
岗位职责
研究领域: 大模型 项目简介: 基于LLM的多Agent协作系统已成为工业级AI产品的核心架构,但部署后的Agent系统如何实现性能的持续进化,而非依赖人工逐一排查和修复,是当前亟待解决的关键问题。 本项目围绕"评估→诊断→进化→验证"闭环,研究如何让多Agent Pipeline具备自我改进的能力。具体包括:构建分层自动化评估体系精准定位各环节性能瓶颈,对Agent间信息传递链路进行保真度诊断与根因归属,设计经验记忆机制与针对性优化策略驱动Agent能力提升,建立可信度元评估保障进化方向正确,并通过A/B实验与回归测试实现改进效果的因果验证。项目的目标是让Agent系统从"人工调优"走向"数据驱动的持续进化",兼具学术前沿性与直接的产品落地价值。
任职要求
-在读硕士或博士研究生,计算机科学、人工智能、自然语言处理等相关专业 -熟悉大语言模型(LLM)的基本原理与使用,了解Prompt Engineering相关方法 -具备扎实的Python编程能力,能够独立完成数据处理、评估脚本开发等工程任务 -对多Agent系统、LLM评估(LLM-as-a-Judge)、Agent自改进、或AI系统质量保障方向有了解或研究兴趣 -具备基本的实验设计与统计分析素养(如A/B测试、评估者间一致性度量等) -具有良好的文献阅读能力,能快速理解和梳理相关领域前沿工作 -逻辑思维清晰,具备将模糊问题形式化定义的能力 -实习期间每周可投入至少4天,持续5-6个月以上
加分项:
-有多Agent框架(如Claude Code、LangChain等)或RAG系统的实际使用经验 -有NLP/LLM相关方向的论文发表或竞赛经历 -有评估体系设计、标注流程搭建、Prompt优化、或数据质量管理的实践经验
特色标签
A/B实验、Agent自改进、Agent自进化、LLM、LLM-as-a-Judge、Prompt优化、Python、保真度诊断、参加算法相关竞赛/获奖、发表算法相关优秀论文、因果验证、多Agent系统、多智能体协作系统、大模型算法、大语言模型、对话系统、意图挖掘、提示工程、文本生成、根因诊断、检索增强生成、检索增强生成系统、算法工程化经验、自动化评估、自我改进、语义理解