Company Didi
Focus Tech · Security
Location 杭州
Published August 26, 2026
主导金融场景下大模型安全对齐的工程化方案设计与迭代。深入优化RLHF/DPO在垂域模型中的训练效率与对齐效果,构建覆盖输入过滤、意图识别、输出审查的多层级护栏系统,确保模型拒答率与误伤率在千万级日调用下达到金融级平衡点。
跟进多模态大模型(图文/音视频)在远程面审、双录质检场景的落地节奏,提前储备并落地低成本、低延迟的多模态安全检测能力。研究方向包括Deepfake检测、跨模态一致性校验、视觉对抗样本防御等,确保多模态攻击面在金融场景中得到有效管控。
建立AI安全内部评测标准体系。设计覆盖"诈骗诱导、隐私泄露、合规红线、业务逻辑绕行"等金融特有维度的安全测试集,并推动评测流程嵌入模型发布门禁
主导构建面向金融黑灰产的自动化红队评测平台。不仅要自己编写越狱及提示注入的自动化攻击脚本,更要设计一套持续对抗训练Pipeline,让防御模型在与红队的"左右互搏"中自动进化,有效抵御针对金融场景的定制化诱导攻击
攻克大模型安全领域在工程化中的痛点,如大模型推理下安全检测的毫秒级延迟要求、护栏系统在高并发场景下的稳定性等。
Fintech Technology