研究型实习生-大模型安全护栏-大模型层次化分类关键技术研究
Company Antgroup
Focus Tech · Security
Location 北京, 杭州
Published May 21, 2026
岗位职责
研究领域: 人工智能安全 项目简介: 大模型安全护栏作为数科商业化产品蚁天鉴的核心能力,其本质是利用大模型对模型输入、输出内容进行准确识别(即LLM-as-classifier)。 当前主流的大模型安全防护机制多采用统一的过滤规则或后置的内容审核策略,缺乏对不同应用场景、用户群体、内容类型和风险等级的精细化区分。这种“一刀切”的安全策略往往导致过度审查或防护不足,难以兼顾安全性与可用性。尤其在面对复杂多变的应用生态时,亟需一种更具适应性、可解释性和可管理性的安全分类体系及快速分类技术。 在此背景下,提出“大模型层次化分类”作为安全护栏构建的关键技术路径具有重要意义。层次化分类旨在依据内容敏感性、应用领域、用户身份、输出影响等级等多维特征,构建一个结构清晰、动态可调的安全分类框架。通过将大模型的输入输出划分为不同安全层级(如公开级、受限级、机密级等),并针对不同层级配置差异化的安全策略(如审核强度、访问权限、日志记录、响应限制等),实现由粗到细、逐层递进的安全管控。
任职要求
研究领域: -目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位 -具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go -具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究 优先录用: -对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色 -在国际会议上或核心期刊发表一份或多份出版物或论文 -至少3个月的全职工作
特色标签
C/C++、Golang、I/O内容判别、Java、Python、信息安全相关专业、信息敏感等级、内容安全、内容安全架构、内容敏感度、分层分类、分层安全控制、分类体系可配置性、分类结果可追溯性、动态安全管控、发表算法相关优秀论文、多级分类、大模型作为分类器、大模型算法、大语言模型分类器、安全、安全产品/平台开发经验、安全体系架构和研发、安全决策可解释性、安全分级框架、安全围栏、安全治理、安全策略可管理性、安全策略强度、安全防护机制、审查强度、审核粒度、意图挖掘、数据敏感性评估、模型交互内容检测、模型可解释性、模型安全网关、算法工程化经验、结构化安全分类、网络安全相关经验、英文可沟通、计算机相关专业、语义理解、语言模型分类范式、输入输出识别、防护能力可调控性、风险分级体系