【Plan A】AI工程师-合成数据科学家(实习)
Campus/Intern
Company Antgroup
Focus Tech · Backend
Location 北京, 杭州
Published May 12, 2026
岗位职责
- 构建文本、图文、音视频等非结构化数据的结构化、标准化的数据处理能力,构建涵盖解析、召回、去重、去毒等多环节的高质量数据处理算子,参与大模型数据处理工程平台建设,推动业务和技术的融合落地;
- 熟练应用 prompt 工程、sft 等技术等,对业界的数据合成、数据优化等新前沿数据处理方法保持持续的追踪,建立针对大模型的数据质量和效果评估方法,持续提高数据质量和多样性,安全性,有用性;
- 实时跟进大模型发布进展,引入有价值的 benchmark,为 scaling&alignment 提供鲁棒的实验观测指标,深度参与 llm 模型效果优化,加速数据系统迭代流程;
- 作为大模型的调教师推进数据构建、评估以及优化。如根据需求制定详实的数据标注、合成、采集等标准,并对数据集进行质量检查和标准迭代,测评模型能力边界,并从数据视角提出优化方案。
📝 你将负责什么? ● 构建“数据工厂”: 研发自动化处理算子,将海量文本、图文、音视频转化为模型可吸收的高能“养料”。 ● 探索数据前沿: 追踪业界最新的数据合成与优化方案,提升数据的质量、多样性与安全性。 ● 扮演“调教师”: 制定标注与采集标准,测评模型边界,从数据视角给出模型进化的方案;引入多样的 Benchmark,驱动数据引入反馈加速模型迭代。
任职要求
- 熟悉 NLP 或者 CV,熟悉分布式计算、gpu 性能调优,有过实际训练 NLP 和 CV 模型并上线的经验;
- 开放敏捷,有强烈的好奇心和独立思考解决问题的能力,具备良好的逻辑思维和高效沟通能力;
- 具备扎实的计算机基础,研究生及以上学历,过往有大模型数据相关研究或实习,或者跨学科复合能力经历者优先; 4、有顶会论文或者优秀开源作品,有 acm/ioi/noi/top coder 等算法竞赛获奖经历优先。
特色标签
Fine-tuning、GPU集群计算、LLM、Prompt调训、Python、云服务、云计算、优秀开源项目经历、内容、内容去毒组件、内容安全、分布式训练、参加算法相关竞赛/获奖、发表算法相关优秀论文、合成样本生成、图像、图像算法、图文数据、基准测试、多模态算法、大数据处理工具(Spark/Hadoop/Hive)、大模型算法、大规模语言模型、对话系统、并行计算、广告、意图挖掘、指令微调、指令调优、推荐、提示语优化、数据去重模块、数据合成、数据安全、数据有效性评估、数据标注规范、数据清洗算子、数据解析器、数据质量检测、数据集评测、文本数据、文本生成、有留学背景、标签体系、样本标注、模型加速/性能优化、深度学习、监督微调、算法工程化经验、聊天机器人、自然语言处理算法、视频、评估指标集、评测基准、语义理解、语音、超大预训练模型、音视频数据、高并发处理