研究型实习生-可信AI安全
Company Antgroup
Focus Tech · Security
Location 北京, 杭州
Published June 23, 2026
岗位职责
研究领域: 人工智能安全 项目简介: 随着大模型及Agent技术的持续演进,其在内容理解、决策推理、任务执行等方面的能力显著提升。但与此同时,模型与Agent的安全性、可控性和可信度问题 也逐渐成为制约其大规模应用的关键因素。当前的防护措施主要集中在后验过滤或人工规则层面,难以适应智能体的自主性需求。本项目聚焦于轻量化、可验证的AI安全对齐机制研究,从模型行为约束、风险检测与安全提示三个维度,探索小规模可验证的技术路线,为后续大模型安全体系奠定基础。
任职要求
职位描述: 1、大模型对抗攻击:研究大模型(llm,vlm,agent)存在的安全性(安全与幻觉)问题,研究大模型对抗攻击/越狱算法和生成式数据增强。 2、大模型对抗防御:研究大模型(llm,vlm,agent)安全防御算法机制,对大模型输入输出做识别、改写、抑制。 3、大模型训练:内生安全对齐,使用continue pretrain、MoE、RAG、AutoPrompt等方法解决大模型安全相关问题。 职位要求: 1、具有多模内容理解、大模型、AI安全相关工作经验优先; 2、计算机、电子等相关专业背景;具备扎实的机器学习基础和较强的学习能力; 3、熟悉PyTorch、Tensorflow相关深度学习算法框架,有相应的模型设计和实现经验; 4、在机器学习/CV/NLP/人工智能相关领域有顶会论文或者有算法竞赛top经验者优先。 5、有一定工程基础或者网络安全经验者有加分。 6、至少6个月的全职工作。
特色标签
AI可信性、AI安全、AI对齐、AI智能体、Python、专家混合架构、事实性错误、内容安全、参加算法相关竞赛/获奖、发表算法相关优秀论文、可信AI、基于检索的生成、多模态大模型、多模态算法、大模型幻觉、大模型算法、大语言模型、安全、安全抑制、对抗样本攻击、对抗防御机制、提示优化、提示注入攻击、智能体、智能提示生成、机器学习、检索增强生成、模型对齐、模型越狱、深度学习、混合专家模型、生成失真、稀疏模型、算法工程化经验、网络安全、自主智能体、自动提示工程、自然语言处理算法、行为对齐、输入输出过滤