【蚂蚁星】算法工程师-强化学习-大安全(实习)
Campus/Intern
Company Antgroup
Focus Tech · Algorithm
Location 北京
Published May 13, 2026
岗位职责
大模型对抗训练的瓶颈,已经从""模型能力""转移到""训练环境""和""迭代效率""。Data Multiverse 当前几个核心限制:
- 一致性兜底覆盖率 ~90%,剩余 10% 集中在数值型特征,是 RL 训练奖励噪声的主要来源;
- 90d 长周期历史保真度仅 83%,长程攻击剧本(养号 → 潜伏 → 变现)的仿真还原度不足;
- 30%~50% 黑盒特征依赖 LLM 推理生成,无法精确校验,限制了仿真置信度上限;
- 场景泛化性不高,迁移到新场景,每次都要重做大量基础设施。 任何一项不解决,攻防大模型自主进化的飞轮就转不起来。这是当前阻塞大模型路线的核心基础设施问题,也是我们相对于业界其它玩家的护城河所在。
任职要求
- 计算机 / AI 相关方向博士在读或应届,研究方向覆盖以下至少1项:数据合成(SDV / TabDDPM / TabSyn 等)、强化学习与多目标优化、自博弈与对抗学习;
- 在顶会有一作,或在数据合成、对抗学习方向有顶会 benchmark 成绩 / 主导过有影响力开源项目;
- 熟悉 RLHF / DPO / Constitutional AI 路线,对 reward 设计和模型优化有深入实践或研究;
- 编码能力扎实,熟悉 PyTorch 与分布式训练 / 推理栈,工程落地能力强。
特色标签
Python、RL、内容安全、分布式训练、发表算法相关优秀论文、合成数据、基于人类反馈的强化学习、基于原则的AI、大模型算法、大规模语言模型、大语言模型、奖励函数设计、奖励建模、安全、宪法AI、对抗学习、并行计算、强化学习、数据安全、数据生成、机器学习、机器强化学习、深度学习、直接偏好优化、算法工程化经验、网络安全、自博弈