【Plan A】医学通用人工智能与世界模型研究员-蚂蚁健康(实习)
Company Antgroup
Focus Tech · Other
Location 上海, 杭州
Published June 11, 2026
岗位职责
部门介绍: 目前,阿福的 C 端产品已经拥有超过 1 亿用户。未来我们将推出全新的“阿福医生端”。目前,在我们的原医生端平台(好大夫)上,已有来自中国三甲医院的超过 30 万名医生入驻。这些医生每天会在平台上为大量患者提供就医建议。 接下来,我们将通过全新的医生端,为这些医生提供最好的服务。
职位描述: 1.前沿方向跟踪 跟踪世界模型、视觉大模型、多模态大模型、视频理解、空间智能等方向的最新进展,持续研究论文、技术报告、开源项目和产品实践; 2.视觉与真实世界理解研究 研究模型如何理解真实世界中的物体、场景、空间关系、运动变化、因果关系和任务过程,探索视觉模型从“识别”走向“理解”和“预测”的能力; 3.技术调研与洞察输出 围绕前沿模型、关键论文和重要技术方向,进行系统调研和分析,输出清晰的技术判断、趋势分析和研究报告; 4.模型能力评测 设计和执行视觉 / 多模态 / 世界模型相关评测任务,分析模型在视频理解、空间推理、动态预测、复杂场景理解等方面的能力边界; 5.研究原型验证 基于视觉模型和多模态模型,参与构建实验原型,验证新的技术假设,并推动研究洞察转化为可验证的系统能力。
任职要求
1.AI 基础扎实 熟悉机器学习、深度学习、计算机视觉、多模态学习或大模型相关技术; 2.关注世界模型与视觉智能 对世界模型、视觉语言模型、视频模型、空间理解、真实世界建模等方向有持续兴趣; 3.论文阅读与学习能力强 能够快速阅读前沿论文和技术资料,理解核心方法、创新点和局限性; 4.具备技术判断力 能够对新技术的价值、边界和发展方向形成自己的判断,而不只是跟踪热点; 5.具备实验和工程能力 熟悉 Python、PyTorch、Hugging Face 等工具,能够完成模型评测、实验分析和原型开发; 6.表达清晰,逻辑严谨 能够将复杂技术问题讲清楚,并输出结构化、有洞察力的研究文档。
加分项 1.在 NeurIPS、ICML、ICLR、CVPR、ICCV、ECCV、ACL、EMNLP 等顶级会议发表过论文; 2.有视觉大模型、视频模型、多模态模型、世界模型相关项目经验; 3.有开源项目、模型、数据集或 benchmark 构建经验; 4.熟悉 GPT、Gemini、Claude、Qwen、Llama、Sora、Veo、SAM、CLIP 等前沿模型或系统; 5.对真实世界理解、物理世界建模、长期记忆、任务规划等问题有深入思考。
特色标签
Python、VLM、医疗、发表算法相关优秀论文、因果建模、因果推理、图像算法、多模态学习、多模态模型、多模态算法、大模型算法、时序视觉模型、时序预测、机器学习、深度学习、物理世界建模、物理世界理解、真实世界建模、空间推理、空间理解、算法工程化经验、自然语言处理算法、视觉模型、视觉语言大模型、视觉语言模型、视频分析、视频模型、视频生成模型、运动预测