研究型实习生-大模型内生安全研究
Company Antgroup
Focus Tech · Security
Location 北京, 杭州
Published June 4, 2026
岗位职责
研究领域: 大模型 项目简介: 岗位描述 本岗位聚焦大语言模型内生安全研究,从模型架构、训练机制与推理过程层面构建本质安全能力。核心研究内容包括但不限于: • 对齐与价值观内化:RLHF/DPO/IPO/Constitutional AI 等对齐方法的改进与鲁棒性分析 • 安全表征与可解释性:理解模型内部安全行为的可解释性表征机制 • 越狱攻防与鲁棒对齐:对抗攻击、越狱攻击的成因分析与内生防御机制设计 • 前沿安全风险分析:围绕前沿大模型安全、Agent安全等风险进行攻击面挖掘与分析
任职要求
岗位要求 1 计算机、电子信息、网络安全、人工智能等相关专业硕士或博士在读; 2 扎实的深度学习基础,有 Transformer 模型训练或微调经验,熟悉前沿深度学习算法框架,有相应的代码实践经验或开源项目经验优先; 3 在以下方向中至少有一项研究或实践经验: • 对齐训练与模型可解释性分析 • 对抗攻防与安全评测 4 良好的英文文献阅读与论文写作能力,实习时长 6 个月及以上 5 在机器学习、AI安全等相关领域有文章发表或人工智能、CTF等领域竞赛获奖者优先。
特色标签
AI可解释性、LLM、Python、人工智能安全、人类反馈强化学习、价值对齐、偏好优化、内容安全、分布式训练、参加算法相关竞赛/获奖、发表算法相关优秀论文、基于人类反馈的强化学习、基于规则的对齐、大模型安全、大模型算法、大模型越狱、大语言模型、安全、宪法AI、宪法式人工智能、对抗攻击、对抗防御、对抗鲁棒性、并行计算、强化学习、提示注入攻击、数据安全、智能体、机器学习、模型可解释性、模型对齐、深度学习、生成式AI安全、直接偏好优化、算法工程化经验、网络安全、自然语言处理算法、行为对齐、规避攻击、隐式偏好优化、隐式偏好建模、黑盒可解释性