岗位职责
团队介绍:数据工程与平台团队旨在实现人类知识与经验向模型能力的加速迁移。我们从真实场景出发,通过模型短板识别、高质量数据定义、规模化数据生产,提升模型能力。与此同时,团队还致力于依托训练反馈,反哺数据设计,推动系统迭代,构建业内一流的数据工程能力与平台。
- 参与大模型训练数据、评测数据、回流数据的算法建设,提升数据生产效率、质量和可规模化能力;
- 设计并实现数据质量评估、数据过滤、数据合成、自动标注、自动质检等模型或算法模块;
- 围绕Coding、Agent、多模态、具身智能、世界模型等高价值场景,建设领域数据处理与评估能力;
- 结合模型训练效果、评测结果和负面案例,进行数据归因分析,发现影响模型能力提升的关键数据因素;
- 跟踪大模型、Agent、强化学习、多模态、数据合成等前沿进展,并将相关方法落地到真实数据生产链路中。
任职要求
- 2027届获得本科及以上学历,计算机、人工智能、软件工程、自动化、数学等相关专业优先;
- 具备扎实的机器学习/深度学习基础,熟悉至少一种主流深度学习框架,如PyTorch、TensorFlow等;
- 具备良好的编程能力和工程实现能力,熟悉Python,理解常见数据结构、算法和系统设计基础;
- 对大模型、Agent、强化学习、多模态、数据合成、模型评测、数据质量评估等方向有浓厚兴趣,并愿意深入真实业务问题;
- 具备较强的问题拆解、实验分析和自驱学习能力,能够在不确定问题中持续探索和迭代。
加分项
- 有大模型训练、后训练、评测、数据合成、RAG、Agent、RLHF/RLAIF、Reward Model等相关研究或项目经历;
- 有Coding Agent、程序分析、自动化测试生成、代码数据处理或代码评测相关经验;
- 有多模态、视频理解、机器人、具身智能、世界模型、仿真环境、轨迹数据等相关经验;
- 在NeurIPS、ICLR、ICML、ACL、EMNLP、CVPR、ICCV、ECCV、KDD、SIGIR等会议或期刊发表过论文,或在Kaggle/ACM-ICPC/开源社区有突出表现者优先。