研究型实习生-LLM后训练强化学习效率与稳定性

Intern

Company Antgroup

Focus Tech · Algorithm

Location 上海, 杭州

Published May 12, 2026

岗位职责

研究领域: 大模型智能体 项目简介: 在我们的业务场景中,需要从黑产交流社区中挖掘宝贵的情报信息用于帮助风控系统提前发现风险、提升防御能力,这其中涉及到基于大模型的智能体自动分析研判黑产信息、决策风险类型和是否预警。但黑产风险研判领域特征强、高质量标注数据收集困难,导致普通的后训练方案很难在少样本情况下稳定地学习到领域知识、实现领域能力的提升;

任职要求

在语言和多模态、强化学习领域有A类论文发表,能够实习三个月以上,2028年及以后毕业的硕博研究生。

特色标签

AI智能体、RL、内容安全、发表算法相关优秀论文、多模态算法、大模型、大模型后训练、大模型智能体、大模型算法、大语言模型、安全、强化学习、强化学习算法、数据安全、智能体、模型后训练、深度学习、自然语言处理算法、风控、风控算法、风险识别、黑产风险研判