岗位职责
团队介绍:视频与边缘部门承载了字节跳动的媒体内容分发基建及技术中台,支持了字节跳动全系产品,如抖音、今日头条、番茄小说、西瓜视频等APP的点播、直播、实时通信、图片等多媒体业务发展,同时将业务发展过程中沉淀下来的技术能力和工具,通过火山引擎对外输出,面向各行各业用户提供视频云产品和服务,愿景是为内外部业务伙伴提供最低成本、最优画质、最低延时、最安全可靠的富媒体内容分发解决方案,助力业务伙伴降本提效实现持续增长。
- 探索多模态视频理解大模型技术前沿,长视频理解、token压缩、影视视频剧本还原、全模态高光理解、流式视频理解、理解和生成统一等技术方向,创新性优化相关算法;
- 全模态大模型(文本、图像、语音)的Post-training算法,同时结合用户消费行为持续优化模型效果,结合LongCOT和RL自主探索学习,探索多模态感知能力的边界;
- 探索视频剪辑Agent相关的研发和应用,研究高质量数据的挖掘和合成、大模型的对齐效率、多目标融合的学习,Agent全链路优化的方法等等;
- 探索直播流式场景比如体育、游戏等实时解说,解决工业级效率和效果难题,支持多语言服务全球化;
- 发表相关技术创新成果,比如顶会论文、专利或比赛。
任职要求
- 2027届获得硕士及以上学位,计算机、人工智能、数学等相关专业优先;
- 熟练掌握Python/C++,熟悉NLP、CV、多模态中的1-2个领域,熟悉大模型训练、RL算法者优先;
- 熟悉Qwen-VL、InternVL、InternVideo等模型,有基于视频Catpion、视频Grounding、视频摘要、视频问答、美学评价、高光检测、动作识别、视频编辑、视频风格化等项目落地经验者加分,能深入解决大模型训练和应用存在的问题;
- 发表过CV/NLP/多模态相关顶会论文(比如CVPR/ICLR/ICCV/PAMI/ACL等)或ACM等竞赛获奖;
- 强烈的技术热爱和好奇心与自主探索能力,优秀的分析和解决问题的能力,和团队一起探索新技术创新和落地。