Token Foundry-图像算法工程师-Qwen Image
Company 通义实验室
Focus 技术 · 算法
北京, 杭州
July 30, 2026
岗位职责
Qwen-Image(千问图像)团队是阿里巴巴ATH事业群-Token Foundry下的图像生成基座团队,自2025年初成立,前后发布了Qwen-Image, Qwen-Image-Edit, Qwen-Image-2.0等一系列文生图、图像编辑基座大模型。Qwen-Image团队正在打造全球领先的图像生成技术体系,推动AI在企业服务、开发者生态、个人内容创作等领域的深度应用,引领下一代人工智能的发展。团队专注于研发视觉生成技术,其中研究内容包括但不限于:图像生成、图像编辑、理解生成一体化等,充分探索相关数据及训练方法研究,以期解决计算机视觉基本问题的同时,为 AI 赋予创造力。
专注于视觉通用大模型的设计、优化与高效部署,具体职责有以下方向: 1、研究高效的视觉通用大模型架构,应对复杂视觉任务,提升模型的准确性和泛化能力; 2、优化算子和通信机制,提升模型训练效率,降低硬件资源消耗,提高训练速度和资源利用率; 3、探索高效的训练策略,包括自适应学习率调整、正则化方法和优化算法选择,提升模型性能和稳定性; 4、设计和实现自动化评估方法,帮助研发团队及时发现模型不足,优化模型架构和训练策略; 5、研发数据过滤和标注相关模型,提高数据质量和可用性,为模型训练提供支持。
任职要求
- 计算机科学、计算机视觉、人工智能、机器学习、具身智能等领域的博士/硕士毕业生。
- 对通用视觉理解或生成模型有一定研究实践,在图像 / 视频 / 3D 等至少一种模态上有实际研发经验。
- 熟练掌握 Pytorch/ Megatron 等大模型框架,有优秀的 coding / 工程能力。
- 自我驱动力,动手能力强,工作细致,对AI行业有浓厚的兴趣,有较强的学习能力和责任心。
- 善于平衡研究目标及落地实现,具备跨学科视野与协作意识,能够与工程、产品等多学科团队紧密合作,推动研究成果快速落地并产生实际影响力。
- 关注技术影响力,具有开源开放精神,对基础模型的前沿问题有持续热情,具备独立思考能力和系统性研究思维,敢于挑战现有范式,能够独立应用技术解决复杂问题。
加分项:
- 曾发表顶级会议论文并具有一定的学术影响力,包括但不限于:CVPR、ECCV、NeurIPS、ICML、ICLR、ACL、TPAMI等国际顶级计算机会议/期刊。
- 拥有知名开源项目,在开源社区具有较好的影响力,或在竞赛中获得引领性的研究成果。
- 具有大规模实战经验。
岗位标签
NEW