达摩院-医疗AI Agent 算法工程师-杭州
Company Alibaba
Focus Tech · Algorithm
Location 杭州
Published September 22, 2026
岗位职责
- 主导临床诊疗 Agent 核心算法研发:任务规划(Planning)、工具调用(Tool Use / MCP)、多轮决策、记忆与反思(Memory & Reflection),构建稳定可靠的 Agent 执行框架。
- 探索 Agentic RL 训练范式(PPO / GRPO / RLVR、过程奖励模型 PRM、Self-play、多轮 rollout),提升 Agent 在长程诊疗路径中的策略优化与自我纠错能力。
- 设计多智能体协作机制(Planner–Executor–Critic、会诊式 Debate、跨模态编排),支撑复杂病例的分层推理与共识决策。
- 研发医疗级 RAG:知识库路由、Query 改写、结构化过滤、引用审计与证据可追溯,保障结论的临床可信度。
- 打通大小模型协同流水线:将病灶检测、异常分类等专科模型输出作为大模型的高价值上下文,形成层级化可解释推理系统。
- 负责 Agent 后训练与对齐:面向轨迹的 SFT / DPO / RLHF、多目标奖励融合,解决 Reward Hacking、安全对齐与医疗偏好优化。
- 构建数据飞轮与合成数据体系:工具调用轨迹、多轮诊疗仿真、病例路径生成,驱动 Agent 能力持续迭代。
- 建设 Agent 评测基准与自动化评估:任务成功率、工具调用准确性、多轮一致性、安全性、合规性与临床有效性。
- 推动 Agent 在疾病筛查、辅助诊断、临床决策支持等场景的产品化落地,与医院、科研机构合作开展临床验证。
任职要求
- 计算机、人工智能、生物医学工程、数学等相关专业硕士及以上。
- 精通 Python 与 PyTorch,具备分布式训练与推理优化的工程能力。
- 在以下至少一个方向具备扎实的理论与实战经验:
- Agent 系统:任务规划、工具调用、多轮决策与编排框架;熟悉 ReAct、Plan-and-Execute、Reflexion 等主流范式。
- Agentic RL:PPO / GRPO / DPO / RLVR、奖励建模、过程奖励(PRM)、Self-play、多轮 rollout 训练。
- 大模型训练与对齐全流程:SFT → RLHF / RL,熟悉主流架构、推理机制与 Test-time Scaling / Reasoning Model。
- RAG 与对话系统:检索、召回、重排、引用生成、多轮对话状态管理。
- 模型协同与系统工程:大小模型协同、层级推理、多模态 Agent 流水线设计。
- 优秀的问题抽象与算法设计能力,能从临床需求提炼技术方向并推动创新方案落地。
- 良好的跨团队协作能力,对 Agent 与医疗 AI 有强烈兴趣与落地责任感。
岗位标签
NEW