阿里控股-大模型安全架构师 / 资深专家-杭州/北京
Company Alibaba
Focus Tech · Security
Location 北京, 杭州
Published August 4, 2026
岗位职责
作为先进大模型安全体系的核心驱动力,负责构建覆盖“数据-训练-推理-应用”全生命周期的大模型安全防御体系。重点结合评测优先和内生安全等理念,从根本上设计并落地具备安全基因的大模型架构,对抗提示注入、越狱攻击、数据泄露及滥用等新型AI安全威胁,确保大模型在高风险业务场景下的可信、可控与合规。 【核心职责】
- 安全评测体系建设 ● 主导构建面向大模型和智能体(LLM/VLM/Agent)的多维度、自动化安全评测平台,覆盖鲁棒性、合规性、偏见歧视、隐私保护、有害内容生成等关键维度 ● 设计并维护动态更新的对抗性测试集与红队(Red Teaming)攻击库,包括但不限于提示注入、越狱攻击、多轮对话诱导等高级攻击手法 ● 研究前沿性AI的风险滥用和失控问题,例如CBRN、伦理、多智能体失控、AI发展提升网络攻击威胁等问题并进行科学和有效的检测度量 ● 建立客观、可量化的安全评分体系及安全等级认证标准,支撑模型上线准入、灰度发布及持续监控。跟踪前沿对抗攻击与防御技术,定期组织针对内部模型的实战对抗演练
- 内生安全机制设计 ● 从架构层面推动“安全左移”,将安全机制内生融入模型预训练、微调(SFT/RLHF)、检索增强生成(RAG)及智能体(Agent)等环节。 ● 研发并落地可插拔的安全对齐技术,如指令鲁棒性增强、安全向量控制、动态系统提示词硬化、自我反思(Self-Correction)机制等。设计针对模型参数、中间激活及梯度的安全检测和隐私保护方案等 ● 探索可解释性安全方法,构建模型决策的内部监控与预警机制,实现安全风险的早期发现与自动响应
- 标准制定与生态合作 ● 主导或参与阿里巴巴在制定企业级大模型安全开发规范、评测标准等方面的工作 ● 代表阿里巴巴参与国内外AI安全标准组织的研讨与标准制定。 ● 建立与学界、业界安全社区的联动机制,持续引入前沿攻击防御技术,输出安全白皮书或专利
任职要求
- 基础能力 ● 硕士及以上学历,计算机、信息安全、人工智能等相关专业,博士优先。5年以上安全或AI领域研发或研究经验,近期经历专注大模型/生成式AI安全 ● 精通大模型技术栈(Transformer架构、RLHF、PEFT、RAG、Agent) ● 深入理解对抗机器学习、差分隐私、鲁棒优化、安全对齐、因果与可解释性等核心安全理论
- 专业能力 ● 评测方向: 精通主流大模型安全评测基准(如SafetyBench, Do-Not-Answer, AdvBench等),并有自主构建高覆盖度、高难度评测集的实际项目经验 ● 攻防方向: 熟练掌握提示注入、越狱、后门攻击等攻击原理,并能设计有效的防御策略(如输入过滤、输出检测、模型硬化等) ● 对齐方向: 对“安全-性能平衡”有深刻洞见,具备在模型训练或推理阶段无损或低损植入安全机制的成功案例 ● 工程能力: 扎实的编程能力(Python/C++),熟悉PyTorch/TensorFlow;有大规模分布式训练或推理服务(vLLM, TensorRT-LLM)性能调优经验者优先
- 亮点与加分项 ● 在顶级安全/AI会议(S&P, CCS, USENIX Security, NeurIPS, ICML, ACL)上发表过多篇大模型安全相关论文 ● 主导过国家级或行业级AI安全攻防竞赛并取得优异成绩,或相关产品和项目获得国内国际同行的认可 ● 拥有大模型安全相关专利或开源项目核心贡献,关键标准的核心贡献者
岗位标签
NEW