大模型应用算法实习生

Intern

Company Kuaishou

Focus Tech · Algorithm

Location 北京

Published September 10, 2026

岗位职责

  1. 负责大模型后训练,评测体系建设;
  2. 运用 SFT、DPO、GRPO、RLHF 等后训练方法对大语言模型进行微调和对齐,提升模型在特定场景下的指令遵循、推理和生成质量;
  3. 模型评测:设计rubrics,Reward Function,建设可量化的模型评测体系;
  4. 参与高质量训练数据的构建:数据合成、清洗、去重、配比,搭建可持续迭代的数据 pipeline;
  5. 跟踪后训练前沿技术(如 Agentic RL、Long CoT、拒绝采样等),进行技术预研和落地验证。

任职要求

  1. 计算机、人工智能、数学等相关专业,本科及以上学历;
  2. 扎实的 Python 编程能力,熟练使用 PyTorch 深度学习框架;
  3. 熟悉大模型训练流程:SFT 微调、大模型强化学习(DPO/GRPO/RLVR)、分布式训练(DeepSpeed/Megatron);
  4. 熟悉主流大语言模型(Qwen、DeepSeek、Llama等)的使用和微调。