研究型实习生-智能设备上的人脸感知研究
Company Antgroup
Focus Tech · Other
Location 上海, 杭州
Published June 3, 2026
岗位职责
研究领域: 人机交互 项目简介: 随着人工智能技术的飞速发展和智能硬件的普及,人机交互的模式正在经历快速的变革,为了实现更流畅、直观和个性化的用户体验,人脸感知技术正日益成为智能设备领域的研究热点,人脸作为人类情感表达、身份识别和社交互动最丰富的载体,蕴含着海量的信息。通过对人脸进行高精度、实时的感知与分析,智能设备能够获得用户更真实更丰富的表情和状态的信息,并能够通过更智能化,更沉浸式的方式进行呈现。这不仅能够提升设备的智能化水平,更能够为用户提供前所未有的个性化服务和交互体验,通过深入研究和攻克这些技术挑战,我们期望能够开发出更智能、更人性化的人脸感知算法和系统,为未来的智能设备带来颠覆性的交互模式和应用体验,从而进一步推动人机共融的进程
任职要求
岗位职责 •研究并开发多模态理解与生成相关算法,覆盖视频、图像、语音、文本等模态,提升模型在多模态感知、对齐、推理与生成方面的能力; •设计和实现多模态数据处理方案,参与高质量多模态数据集的构建,包括数据采集、清洗、标注、对齐与质量评估; •优化模型结构、训练策略与评测流程,提升模型效果、泛化能力与鲁棒性; •与产品、工程团队紧密协作,推动算法在实际业务场景中的部署、优化与迭代,提升用户体验。 岗位要求 •计算机科学、电子工程、人工智能等相关专业硕士及以上学历,熟悉 Python 及 PyTorch 深度学习框架; •理解 Transformer 架构及其常见变体,熟悉多模态大模型的基本架构设计与实现思路,了解代表性模型如 LLaVA, Qwen-VL 7f; •熟悉主流视频/音频预训练模型或 backbone,如 VideoMAE、SlowFast、Whisper、HUBERT 等,并了解其在多模态任务中的应用; •熟悉大模型指令微调(SFT)流程,了解或实践过大模型对齐相关方法,如DPO、PPO、RLHF 等; •具备较强的问题分析与解决能力,良好的团队协作能力和沟通能力。 加分项 •有多模态大模型训练、微调或评测经验; •有数据构建、数据清洗、标注策略设计经验; •熟悉分布式训练、混合精度训练、推理加速; •有开源项目、论文或比赛成果者优先。
特色标签
Python、Transformer模型、人机交互技术、人机共融、人类偏好对齐、人脸分析、分布式训练、参加算法相关竞赛/获奖、图像、图像算法、声学特征提取模型、多模态大语言模型、多模态数据、多模态理解、多模态生成、多模态算法、多源数据集、大模型算法、强化学习、强化学习对齐、指令调优、时序视觉模型、智能交互、有监督微调、模型加速/性能优化、模型对齐、深度学习、监督微调、算法工程化经验、编解码器架构、自注意力模型、自然语言处理算法、融合式大模型、行为对齐、表情识别、视觉语言大模型、视频表征学习模型、视频骨干网络、语音、语音算法、语音骨干网络、跨模态数据集、跨模态理解、跨模态生成、面部感知、面部状态识别、音频表征学习模型