阿里控股-AI算法工程师-AI数据资产
Company 阿里巴巴
Focus 技术 · 算法
北京, 杭州
July 29, 2026
岗位职责
- 负责大模型训练数据资产的质量评估与分析建设,围绕文本、多模态等数据建立清洗、去重、完整性校验、质量分级等能力,提升数据可用性与训练收益。
- 负责数据资产标签体系、分类分级体系及质量评估模型建设,支持数据资产的盘点、洞察、管理与复用。
- 基于向量检索、语义匹配、聚类分析等技术,建设数据资产的语义索引、检索发现与相似性分析能力。
- 跟踪国内外前沿开源数据集、学术数据集及竞品数据建设方向,结合模型能力发展判断外部数据价值,输出数据资产地图与储备建议。
- 与训练、评测、工程、平台、情报、领域专家等团队紧密协作,持续优化数据评估算法与资产管理体系,形成“模型反馈 → 数据洞察 → 资产优化 → 能力提升”的正向飞轮。
任职要求
- 计算机、人工智能、数学、统计学等相关专业,硕士及以上学历。
- 熟悉机器学习、深度学习及主流大模型技术体系,具备大模型预训练、SFT、RL 等训练阶段的实战经验,深刻理解不同训练阶段对数据分布、质量和多样性的核心诉求。
- 熟悉文本/多模态数据质量评估方法,具备重复检测、数据清洗、完整性校验、污染分析等实战经验;熟悉 SFT、RL 训练数据构造流程,了解大模型训练数据的前沿实践。
- 熟悉大规模数据分析与可视化方法,具备标签体系设计、数据分类分级、质量建模等经验;熟悉向量检索、Embedding、语义匹配等相关技术,有数据资产检索、语义索引或数据平台建设经验者优先。
- 具备较强的行业研究与信息检索能力,能够系统追踪国内外 frontier 数据动态、开源数据集及竞品数据建设方向,并从模型能力维度评估外部数据的战略价值。
- 熟练使用 Python,能够独立完成数据处理脚本、评估 Pipeline 及分析工具开发;具备优秀的书面表达与跨团队沟通能力,能够将算法侧反馈准确转化为数据策略,并推动落地执行。 加分项
- 有 Agent、Code、Multimodal 方向的数据构造、评估或训练经验。
- 有数据平台、数据治理、知识库、搜索/推荐、语义检索等相关经验。
- 对 LLM/AGI 方向有持续关注,具备较强的技术敏感度与学习能力,习惯使用 AI 工具提升数据工作效率者优先。
岗位标签
NEW