【北斗】多模态数字人算法研究员
Company Meituan
Focus Tech · Algorithm
Location 北京
Published June 3, 2026
岗位职责
【愿景】 成为本地生活领域虚拟服务解决方案的头部玩家,打造AI驱动的下一代智能直播基础设施。
【你将参与】 1.以人为中心的视频生成研究与应用:负责基于扩散模型/Transformer架构的人物视频生成算法研发,重点攻克人体姿态可控性、外观保真度、时序连贯性等核心难题,目标实现业界领先的生成质量,在数字人直播场景落地应用。 2.流式视频生成/动作生成技术探索:设计并实现低延迟流式推理框架,探索Token级增量生成、因果注意力机制等前沿方向,构建端到端生成低延迟解决方案,支撑实时交互场景落地。 3.多模态驱动的动作生成:研究基于文本/音频/姿态等多模态信号控制的人体动作生成算法,涵盖全身动作、手势、表情及唇型驱动,实现高自然度、多样性的动作合成,并完成从研究到相应线上产品的闭环交付。 4.AI数字人算法落地与优化:主导数字人生成全链路开发和优化,包括模型迭代、训练加速、推理提速,推动数字人生成效果,保障线上服务稳定性。
任职要求
【任职资格】 基本要求: 1.计算机科学、人工智能、电子信息等相关专业硕士及以上学历; 2.精通至少一种视频生成基座框架(如DiT、UNet-based Diffusion等),熟悉大模型后训练技术(SFT/RLHF等); 3.熟悉主流的视频生成加速技术(如模型并行、推理优化、流式生成架构); 4.熟悉SMPL/FLAME/ARKIT等人体/人脸表征建模,掌握多模态控制动作生成主流方法; 5.在CV/ML/MM方向顶级会议或期刊(CVPR、ICCV、ECCV、NeurIPS、ICML、ACM MM、TPAMI等)上发表过论文; 6.有主导算法创新研究的完整经验(从idea提出到实验验证到论文发表)。 加分项: 1.有数字人相关实际项目经验(如唇驱、Talking Head、全身驱动、3D虚拟人等); 2.有开源项目或竞赛获奖经历。 【为什么是我们】 团队核心成员深耕数字人算法多年,产研落地经验丰富,在数字人/视频生成相关方向上发表顶会论文数十篇。该岗位技术创新与业务价值并重,数据场景丰富、GPU资源充裕,研究成果能快速触达亿级用户。