蚂蚁集团-全网数据算法专家-杭州
Company Antgroup
Focus Tech · Algorithm
Location 杭州
Published September 22, 2026
岗位职责
- 负责全网高价值互联网数据源发现和识别筛选,涵盖网页、PDF、音视频等多模态来源,分析数据天花板,评估数据价值和优先级,支持医疗、金融、大模型和智能应用等核心领域数据全面覆盖;
- 负责全网数据采集相关链接和网页特征算子研发和水位提升,持续优化提升数据任务和系统能力水位,充分支持模型训练、RAG搜索等数据需求;
- 持续提升技术竞争力,在数据覆盖、数据时效、下载渲染成功率、死链监测、采集成本方面做到行业领先水位;
- 帮助提升团队算法能力,进行技术分享和人才培养,指导领域新同学和研究实习生工作。
任职要求
- 计算机、人工智能、大数据或者相关专业本科及以上学历,3年以上大规模数据采集、处理、搜索推荐等相关领域经验;
- 熟悉文本分类、聚类、NER等NLP及相关领域的机器学习算法,能设计数据价值评估、优先级排序的落地方案;有大模型训练数据构建、RAG数据链路经验优先;
- 对金融/医疗/大模型至少一个领域数据生态有较深理解,能独立完成数据源发现、价值评估与优先级排序,能够从业务目标定位数据缺口并制定高效策略;
- 有比较强的自驱力和协作能力,具备技术分享与人才培养意识,有指导新同学/实习生的实际经验优先.
岗位标签
NEW
特色标签
LLM训练语料、Python、RAG链路、Retrieval-Augmented Generation、SQL、Web全量数据、互联网全域数据、全网络数据、分布式训练、医疗、团队管理经验、图文音视频混合、多媒体模态、多模态算法、大数据处理工具(Spark/Hadoop/Hive)、大模型算法、大模型预训练数据、大规模语言模型训练集、失效链接检测、抓取费用、推荐算法、搜索算法、数据价值打分、数据优先级评估、数据效用衡量、数据源头识别、数据源探测、数据获取成本、新数据站点挖掘、机器学习、检索增强生成、死链扫描、爬取成本、算法工程化经验、语义理解、跨媒体形态、金融、链接存活监控