ATH事业群-大模型安全算法专家--杭州Company AlibabaFocus Tech · SecurityLocation 杭州Published August 24, 2026岗位职责 深度挖掘大模型在复杂任务、长尾场景、不同语种下的弱点,设计并构建具有可扩展性的自动化评测方案及高质量数据集; 参与 LLM-as-a-Judge 方案的设计与实现,训练高精度的 Reward Model(奖励模型),建模人类偏好,提升模型在指令遵循、安全性及复杂逻辑上的表现; 设计高效的 Reward Signal(奖励信号)并合成对应数据,通过强化学习(RL)算法持续提升模型的能力上限与泛化性; 参与开发 Evaluation 与 Reward System 所需的工程框架,简化多任务测试流程,提升大规模模型集成与实验的效率; 跟踪全球大模型最新进展(如 Agent 评测、多模态对齐、自动化数据合成等),推动研究成果在真实业务场景中的落地。 任职要求 硕士及以上学历,计算机、人工智能、软件工程、数学、自动化等相关专业优先; 深入理解 Transformer 架构及大语言模型基础知识,熟悉模型评测方案(Evaluation)或具有后训练(Post-training,如 SFT、RL等)经验; 具备卓越的代码工程能力,精通 Python 编程及 PyTorch、TensorFlow 等深度学习框架;有模型训练、推理加速或自动化数据合成经验者优先; 具备系统性研究思维,在国际顶级计算机会议/期刊(如 NeurIPS、ICML、ICLR、ACL、EMNLP 等)发表过一作论文,或在知名开源社区、顶级竞赛(如 ACM/ICPC、Kaggle)中有突出成果者优先; 具备跨学科视野,良好的沟通能力和团队协作精神。