达摩院-医疗AI Agent 算法工程师-杭州

Company Alibaba

Focus Tech · Algorithm

Location 杭州

Published September 22, 2026

岗位职责

  • 主导临床诊疗 Agent 核心算法研发:任务规划(Planning)、工具调用(Tool Use / MCP)、多轮决策、记忆与反思(Memory & Reflection),构建稳定可靠的 Agent 执行框架。
  • 探索 Agentic RL 训练范式(PPO / GRPO / RLVR、过程奖励模型 PRM、Self-play、多轮 rollout),提升 Agent 在长程诊疗路径中的策略优化与自我纠错能力。
  • 设计多智能体协作机制(Planner–Executor–Critic、会诊式 Debate、跨模态编排),支撑复杂病例的分层推理与共识决策。
  • 研发医疗级 RAG:知识库路由、Query 改写、结构化过滤、引用审计与证据可追溯,保障结论的临床可信度。
  • 打通大小模型协同流水线:将病灶检测、异常分类等专科模型输出作为大模型的高价值上下文,形成层级化可解释推理系统。
  • 负责 Agent 后训练与对齐:面向轨迹的 SFT / DPO / RLHF、多目标奖励融合,解决 Reward Hacking、安全对齐与医疗偏好优化。
  • 构建数据飞轮与合成数据体系:工具调用轨迹、多轮诊疗仿真、病例路径生成,驱动 Agent 能力持续迭代。
  • 建设 Agent 评测基准与自动化评估:任务成功率、工具调用准确性、多轮一致性、安全性、合规性与临床有效性。
  • 推动 Agent 在疾病筛查、辅助诊断、临床决策支持等场景的产品化落地,与医院、科研机构合作开展临床验证。

任职要求

  • 计算机、人工智能、生物医学工程、数学等相关专业硕士及以上。
  • 精通 Python 与 PyTorch,具备分布式训练与推理优化的工程能力。
  • 在以下至少一个方向具备扎实的理论与实战经验:
    • Agent 系统:任务规划、工具调用、多轮决策与编排框架;熟悉 ReAct、Plan-and-Execute、Reflexion 等主流范式。
    • Agentic RL:PPO / GRPO / DPO / RLVR、奖励建模、过程奖励(PRM)、Self-play、多轮 rollout 训练。
    • 大模型训练与对齐全流程:SFT → RLHF / RL,熟悉主流架构、推理机制与 Test-time Scaling / Reasoning Model。
    • RAG 与对话系统:检索、召回、重排、引用生成、多轮对话状态管理。
    • 模型协同与系统工程:大小模型协同、层级推理、多模态 Agent 流水线设计。
  • 优秀的问题抽象与算法设计能力,能从临床需求提炼技术方向并推动创新方案落地。
  • 良好的跨团队协作能力,对 Agent 与医疗 AI 有强烈兴趣与落地责任感。

岗位标签

NEW