CTO-大模型-语料处理
Campus/Intern
Company Antgroup
Focus Tech · Algorithm
Location 北京, 上海, 杭州, 成都
Published April 23, 2026
岗位职责
大模型的效果依赖高质量的语料,但开源/互联网数据存在噪声大、标注粗糙、分布不均衡等问题。传统人工清洗与标注成本高、效率低,且难以有效地提升大模型的效果。在本课题中,我们希望:
- 研发高效的自动化数据优化技术,包括数据清洗、标注增强、分布对齐、数据筛选等环节,来提升数据处理的效率;
- 研究数据和模型效果之间的关联,提升面向效果的数据处理效率和效果。
任职要求
- 目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位;
- 具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go;
- 具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究。
优先录用:
- 对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色;
- 在国际会议上或核心期刊发表一份或多份出版物或论文;
- 至少3个月的全职工作。
特色标签
C/C++、Golang、Java、Python、内容、分布匹配、分布平衡、发表算法相关优秀论文、大尺度模型、大数据、大模型算法、大规模语言模型、大语言模型、意图挖掘、数据-模型关联分析、数据净化、数据分布校正、数据去噪、数据效用分析、数据过滤、数据选择、数据预处理、数据驱动效果评估、文本数据、文本生成、智能数据优化、有留学背景、标注、标注优化、标签增强、标签细化、样本筛选、模型加速/性能优化、深度学习、自动数据提升、自动数据治理、训练数据、语义理解、语料库