岗位职责
深入参与阿里云MaaS平台视频生成核心算法研发,致力于构建行业领先的AIGC视频创作能力。依托多模态/全模态大模型、图像/视频生成模型及Agent等前沿技术,打造下一代智能化视频创作平台,赋能短剧/漫剧、互动娱乐、电商广告等核心业务场景。具体工作内容包括:
- 视频生成模型后训练:基于Wan/HappyHorse系列模型进行精调与优化。负责高质量视频数据的清洗与标注体系建设,通过 SFT与 RLHF,提升模型在特定业务场景下的生成表现;
- 视频创作智能体:研发基于大模型的视频创作工作流智能体,实现“脚本策划-分镜生成-角色一致性控制-视频渲染”的全链路自动化;探索长视频生成的逻辑连贯性与复杂指令遵循,提升多模态模型在视频创作中的自主工具调用与“评价-反思-优化”闭环能力;
- 生成质量评估体系:构建多维度的视频生成评估框架。结合客观指标与基于大模型的多模态内容评估,建立基于Agent架构的自主化、动态化评测机制,高效驱动模型迭代。
任职要求
- 硕士及以上学历,计算机、人工智能、数学等相关专业;具备深厚的机器学习、计算机视觉或计算机图形学基础;
- 具备优秀的编程能力与数据结构基础,熟练掌握 Python/C++ 及 PyTorch 等主流深度学习框架;拥抱 AI 时代开发模式,熟练使用 AI 辅助编程工具以提升研发效率;
- 具有图像/视频生成、多模态理解、智能体相关项目经历或学术背景;熟悉大模型结构设计、训练优化、强化学习、Agent 编排或自进化等技术;
- 加分项 :(1)在CVPR,ICCV,SIGGRAPH,NeurIPS,ICLR等国际顶会发表过多模态生成/理解或Agent相关论文者优先;(2)在权威图像/视频生成、多模态评测榜单中取得优异成绩,或在开源社区(如HuggingFace,GitHub)有高星项目贡献者优先。
岗位标签
NEW