蚂蚁健康-医学通用人工智能与世界模型实习生
Company Antgroup
Focus Tech · Other
Location 上海, 杭州
Published June 10, 2026
岗位职责
1.AI 基础扎实 熟悉机器学习、深度学习、计算机视觉、多模态学习或大模型相关技术; 2.关注世界模型与视觉智能 对世界模型、视觉语言模型、视频模型、空间理解、真实世界建模等方向有持续兴趣; 3.论文阅读与学习能力强 能够快速阅读前沿论文和技术资料,理解核心方法、创新点和局限性; 4.具备技术判断力 能够对新技术的价值、边界和发展方向形成自己的判断,而不只是跟踪热点; 5.具备实验和工程能力 熟悉 Python、PyTorch、Hugging Face 等工具,能够完成模型评测、实验分析和原型开发; 6.表达清晰,逻辑严谨 能够将复杂技术问题讲清楚,并输出结构化、有洞察力的研究文档。 加分项 1.在 NeurIPS、ICML、ICLR、CVPR、ICCV、ECCV、ACL、EMNLP 等顶级会议发表过论文; 2.有视觉大模型、视频模型、多模态模型、世界模型相关项目经验; 3.有开源项目、模型、数据集或 benchmark 构建经验; 4.熟悉 GPT、Gemini、Claude、Qwen、Llama、Sora、Veo、SAM、CLIP 等前沿模型或系统; 5.对真实世界理解、物理世界建模、长期记忆、任务规划等问题有深入思考。
任职要求
1.前沿方向跟踪 跟踪世界模型、视觉大模型、多模态大模型、视频理解、空间智能等方向的最新进展,持续研究论文、技术报告、开源项目和产品实践; 2.视觉与真实世界理解研究 研究模型如何理解真实世界中的物体、场景、空间关系、运动变化、因果关系和任务过程,探索视觉模型从“识别”走向“理解”和“预测”的能力; 3.技术调研与洞察输出 围绕前沿模型、关键论文和重要技术方向,进行系统调研和分析,输出清晰的技术判断、趋势分析和研究报告; 4.模型能力评测 设计和执行视觉 / 多模态 / 世界模型相关评测任务,分析模型在视频理解、空间推理、动态预测、复杂场景理解等方面的能力边界; 5.研究原型验证 基于视觉模型和多模态模型,参与构建实验原型,验证新的技术假设,并推动研究洞察转化为可验证的系统能力。
特色标签
CV、DNN、Hugging Face、ML、Python、PyTorch、SLAM、VLM、三维重建、世界模拟器、世界生成模型、优秀开源项目经历、传统图像算法、具身智能、分布式训练、医疗、发表算法相关优秀论文、图像、图像生成、图像算法、多模态算法、多模态融合、大模型算法、大规模预训练模型、意图挖掘、文本生成、智能交互、智能体、有留学背景、机器人、机器学习、机器学习算法、机器视觉、深度大模型、深度学习、深度神经网络、点云算法、物理世界建模、目标检测、真实场景建模、知识图谱、空间智能、空间认知、算法工程化经验、自动驾驶、自然语言处理算法、英美留学生、视觉-文本模型、视频、视频理解模型、视频生成模型、语义理解、跨模态学习