【蚂蚁星】算法工程师-强化学习-大安全-27届
Campus/Intern
Company Antgroup
Focus Tech · Algorithm
Location 北京
Published May 14, 2026
岗位职责
大模型对抗训练的瓶颈,已经从""模型能力""转移到""训练环境""和""迭代效率""。Data Multiverse 当前几个核心限制:
- 一致性兜底覆盖率 ~90%,剩余 10% 集中在数值型特征,是 RL 训练奖励噪声的主要来源;
- 90d 长周期历史保真度仅 83%,长程攻击剧本(养号 → 潜伏 → 变现)的仿真还原度不足;
- 30%~50% 黑盒特征依赖 LLM 推理生成,无法精确校验,限制了仿真置信度上限;
- 场景泛化性不高,迁移到新场景,每次都要重做大量基础设施。 任何一项不解决,攻防大模型自主进化的飞轮就转不起来。这是当前阻塞大模型路线的核心基础设施问题,也是我们相对于业界其它玩家的护城河所在。
任职要求
- 计算机 / AI 相关方向博士在读或应届,研究方向覆盖以下至少1项:数据合成(SDV / TabDDPM / TabSyn 等)、强化学习与多目标优化、自博弈与对抗学习;
- 在顶会有一作,或在数据合成、对抗学习方向有顶会 benchmark 成绩 / 主导过有影响力开源项目;
- 熟悉 RLHF / DPO / Constitutional AI 路线,对 reward 设计和模型优化有深入实践或研究;
- 编码能力扎实,熟悉 PyTorch 与分布式训练 / 推理栈,工程落地能力强。
特色标签
algorithm-related-excellent-paper-publication、LLM、modeling_algorithm、optimization_algorithm、Python、risk_control_algorithm、RL、SDV、TabDDPM、TabSyn、人类反馈强化学习、偏好优化、分布式模型训练、分布式深度学习训练、分布式训练、合成数据、基于人类反馈的强化学习、基于规则的AI对齐、多目标强化学习、大模型算法、大语言模型、奖励函数设计、奖励工程、奖励建模、宪法AI、对抗学习、对抗样本训练、对抗环境仿真、并行计算、强化学习、强化学习算法、攻防仿真、数据生成、深度学习、生成式大模型、直接偏好优化、约束式AI对齐、自博弈、表格数据合成、训练环境仿真