【Plan A】AI工程师-合成数据科学家-27届
Campus/Intern
Company Antgroup
Focus Tech · Backend
Location 北京, 杭州
Published May 14, 2026
岗位职责
- 构建文本、图文、音视频等非结构化数据的结构化、标准化的数据处理能力,构建涵盖解析、召回、去重、去毒等多环节的高质量数据处理算子,参与大模型数据处理工程平台建设,推动业务和技术的融合落地;
- 熟练应用 prompt 工程、sft 等技术等,对业界的数据合成、数据优化等新前沿数据处理方法保持持续的追踪,建立针对大模型的数据质量和效果评估方法,持续提高数据质量和多样性,安全性,有用性;
- 实时跟进大模型发布进展,引入有价值的 benchmark,为 scaling&alignment 提供鲁棒的实验观测指标,深度参与 llm 模型效果优化,加速数据系统迭代流程;
- 作为大模型的调教师推进数据构建、评估以及优化。如根据需求制定详实的数据标注、合成、采集等标准,并对数据集进行质量检查和标准迭代,测评模型能力边界,并从数据视角提出优化方案。
📝 你将负责什么? ● 构建“数据工厂”: 研发自动化处理算子,将海量文本、图文、音视频转化为模型可吸收的高能“养料”。 ● 探索数据前沿: 追踪业界最新的数据合成与优化方案,提升数据的质量、多样性与安全性。 ● 扮演“调教师”: 制定标注与采集标准,测评模型边界,从数据视角给出模型进化的方案;引入多样的 Benchmark,驱动数据引入反馈加速模型迭代。
任职要求
- 熟悉 NLP 或者 CV,熟悉分布式计算、gpu 性能调优,有过实际训练 NLP 和 CV 模型并上线的经验;
- 开放敏捷,有强烈的好奇心和独立思考解决问题的能力,具备良好的逻辑思维和高效沟通能力;
- 具备扎实的计算机基础,研究生及以上学历,过往有大模型数据相关研究或实习,或者跨学科复合能力经历者优先; 4、有顶会论文或者优秀开源作品,有 acm/ioi/noi/top coder 等算法竞赛获奖经历优先。
特色标签
GPU优化、LLM、Python、Shell、云原生、云服务、云计算、人类对齐、价值对齐、优秀开源项目经历、内容、内容安全、分布式计算、分布式训练、参加算法相关竞赛/获奖、发表算法相关优秀论文、合成数据、图像、图像算法、基准测试、多模态算法、大数据、大数据处理工具(Spark/Hadoop/Hive)、大模型算法、大规模预训练模型、大语言模型、对齐、并行计算、广告、指令微调、推荐、提示优化、提示工程、提示设计、提示调优、搜索、数据净化、数据增强、数据安全、数据扩充、数据清洗、数据生成、文本生成、显存优化、智能体、智能研发、有害内容过滤、有留学背景、有监督微调、标准测试集、标注、模型加速/性能优化、模型对齐、模型扩容、毒性过滤、深度学习、监督微调、直播、知识图谱、短视频、算子优化、算法工程化经验、自然语言处理算法、英美留学生、规模扩展、规模放大、视频、评估基准、评测基准、语义理解、语音、集群计算