岗位职责
团队介绍:作为一家拥有自主创新和研发创造能力的科技品牌,PICO致力于成为领先的世界级XR平台,成就开发者与创作者,共同为全球消费者创造更美好的生活体验。我们开创性地将虚拟现实扩展到了多个领域,为运动、视频、娱乐等消费级场景带来了全新体验;并广泛应用在教育、医疗和企业培训等商用场景,给全球企业级用户提供了多元化的VR解决方案。
- 负责实时视觉语言交互系统的架构设计与核心模块开发,实现视频流、语音、文本多模态输入的融合交互能力;
- 研发实时视频理解、流式多模态对齐、主动交互决策等核心算法,持续优化交互的准确性、连贯性与自然度;
- 负责多模态交互系统的全链路工程落地,包含多源视频流接入、低延迟推理调度、语音交互模块、业务接口封装等;
- 针对实时推理场景进行性能优化,降低端到端响应延迟,优化长时视频的显存与算力占用,提升系统并发处理能力;
- 参与多模态交互数据集构建、模型微调与效果评测体系建设,持续迭代模型与系统效果;
- 跟踪流式多模态大模型、长视频理解、主动交互范式等领域前沿技术,结合业务需求开展技术预研与落地验证。
任职要求
- 2027届获得硕士及以上学位,计算机、电子信息、自动化等相关专业;
- 有多模态大模型或计算机视觉相关研发经验,精通PyTorch深度学习框架,具备扎实的算法基础,深入理解Transformer、ViT、多模态特征对齐等核心技术原理;
- 熟悉主流多模态大模型的架构与训练推理流程,具备VLM模型微调、部署落地的实操经验;
- 具备实时视频理解、流式多模态交互相关项目经验,熟悉视频流处理、帧采样、时序建模等相关技术;
- 具备良好的工程实现能力,熟悉vLLM等主流大模型推理框架,有低延迟推理系统开发与优化经验者优先;
- 具备较强的问题分析与解决能力,能够独立完成技术方案设计与落地,拥有良好的团队协作与沟通能力。
加分项:
- 有开源多模态项目贡献经历,具备主流多模态系统二次开发与定制化经验;
- 具备vLLM定制化开发、KV Cache优化、低位量化推理等性能优化经验;
- 熟悉强化学习在多模态交互决策中的应用,有RLHF/DPO相关训练经验;
- 具备端侧多模态模型部署、边缘计算设备适配经验。