Token Foundry-基础大模型预训练数据算法-QwenCompany TongyiFocus Tech · AlgorithmLocation 北京, 杭州Published August 23, 2026岗位职责 负责Qwen大模型预训练数据的算法设计与体系建设,面向海量文本、代码、多模态等数据,开展数据采集扩充、质量评估、筛选配比和合成优化,建设高质量、可持续迭代的预训练数据管线; 持续建设面向mid-train阶段的模型驱动的合成与质检链路,围绕知识、推理、代码、长文、Agent、多模态等核心能力方向,形成数据生产、质量控制与训练反馈的闭环优化机制,不断提升数据密度、能力针对性与最终训练收益; 持续完善数据实验与验证链路,构建覆盖不同模型参数规模的数据scaling研究策略,系统分析数据策略在不同参数规模下的收益迁移与效果一致性,同时丰富预训练评测体系,跟进大模型前沿技术研究,推动预训练数据闭环迭代,打造业内领先的数据算法能力。 任职要求 毕业于全球Top高校计算机科学、人工智能、机器学习、软件工程或相关专业,具备扎实的学术基础与技术能力,博士优先; 在大语言模型或多模态大模型相关方向具备深厚的理论基础和实践经验,在深度学习、优化算法、大规模数据处理、大规模模型训练等领域取得过突出成果; 具备优秀的研究与工程能力,在顶级会议/期刊发表过高水平论文,或在开源、竞赛、产业项目中展现出有影响力的成果; 熟悉主流深度学习框架、分布式计算框架,能够高效完成复杂模型和数据算法实现与大规模训练优化; 对前沿AI技术充满热情,具备独立思考、系统研究、复杂问题解决以及良好的协作沟通能力,能够推动研究成果高效落地。