研究型实习生-医疗数字人多模态交互算法研究
Campus/Intern
Company Antgroup
Focus Tech · Algorithm
Location 杭州
Published December 30, 2025
岗位职责
研究领域: 人工智能 项目简介: 随着远程医疗、居家康复、互联网医院等场景爆发式增长,医患之间“面对面”实时交互从“线下”迁移到“线上”。传统文字/图片问诊已无法满足听诊、视诊、康复指导、急救指挥等强实时、强感官的临床需求。 项目聚焦“听得到、看得见、看得懂、答得准”四大痛点,构建一套医疗级、低延时、可解释、可扩展的音视频多模态实时交互 Agent 框架。通过融合图像、视频、音频、文字、结构化数据等模态数据,实现接近真人医生视频对话的实时交互效果,提升用户体验,保障在AI诊疗任务中的识别效果。
任职要求
要求
- 目前正在攻读计算机科学、人工智能、语音信号处理或相关领域的硕士或博士学位。
- 具备扎实的多模态信号处理和深度学习基础,有计算机视觉(CV)、语音合成(TTS)、语音识别(ASR)、语音对话系统等相关项目经验。
- 熟练掌握Python,熟悉PyTorch、TensorFlow等深度学习框架。
- 有相关领域的高质量论文或开源项目成果。 加分项
- 有医疗AI、医疗NLP或医疗语音处理相关项目经验。
- 有原生多模态大模型训练优化经验。
- 熟悉流式语音处理技术,有实时语音系统开发经验。
特色标签
AI、ASR、CNN/RNN、CV、Python、TensorFlow/PyTorch、TTS、交互系统、人机对话相关经验、优秀开源项目经历、低延时交互、医疗、医疗人工智能、发表算法相关优秀论文、图像、图像识别、在线语音识别、多模态交互、多模态算法、多源信息融合、大模型算法、实时通信、对话系统、意图挖掘、文本转语音、智慧医疗、智能交互、智能代理、智能体、有国际期刊/会议论文发表、流式ASR、深层模型、深度学习、神经网络、视频、视频分析、计算机相关专业、语义理解、语音、语音算法、语音识别工作经验、语音转文本、通信/信号处理相关专业