安全垂直领域大模型训练框架研发

Campus

Company Jd

Focus Tech · Security

Location 北京

Published August 17, 2026

岗位职责

  1. 负责信息安全领域大模型预训练与后训练算法研发,涵盖CPT、SFT、强化学习(RLHF/RLAIF/DPO等)及Agentic训练方法,优化长上下文、工具调用与代码安全分析能力。
  2. 主导安全Agent强化学习(Agent-RL)框架设计与训练,攻坚面向安全场景的环境建模、奖励函数设计、策略优化与长程任务规划。
  3. 搭建支持漏洞挖掘、渗透测试、日志分析与情报研判的交互式训练环境,解决安全场景环境复杂、奖励稀疏及探索效率低等技术难题。
  4. 设计并优化安全Agent训练数据流水线,构建高质量专业语料库,实现数据合成、轨迹回放与质量评估的端到端自动化。
  5. 建立健全安全大模型评测基准(Benchmark)与指标体系,基于误报、漏报及对抗鲁棒性等多维分析,持续驱动模型算法迭代与落地。

任职要求

  1. 计算机科学、人工智能、网络安全等相关领域的本硕博在校生。
  2. 具备大规模语言模型预训练或后训练实战经验,精通Transformer等主流架构,具备大模型从零训练或全参数微调经验;熟练掌握DeepSpeed、Megatron-LM等分布式训练框架;深入理解RLHF、DPO、PPO、GRPO等对齐训练方法,或具备Agentic训练(如Tool Use、Code Agent)相关项目经历。
  3. 深入理解至少一个安全细分领域(涵盖网络安全、数据安全、内容安全、业务风控、漏洞挖掘等),具备将安全场景需求转化为算法模型任务的能力。
  4. 在AI顶级会议(如NeurIPS、ICML、ICLR等)或安全顶级会议(如CCS、USENIX Security等)有论文发表经历,或作为核心开发者参与过业界高影响力开源项目者优先。
  5. 具备优秀的创新能力、逻辑推演能力与自我挑战精神,拥有良好的跨团队协同意识。

部门/板块

京东集团