多模态算法工程师
Company 京东
Focus 技术 · 算法
北京
July 7, 2026
岗位职责
- 多模态大模型(VLM)后训练与强化学习攻坚: 主导多模态大模型的 SFT 与对齐工作。重点负责构建和优化 RLHF/DPO/PPO 等强化学习训练链路,深入攻克 Reward Model 训练、强化学习训练不稳定性等难题,极致优化模型在复杂图文理解、逻辑推理及指令遵循上的表现。
- 企业级 RAG 系统架构与优化: 负责构建工业级的大规模检索增强生成(RAG)系统。针对高并发、复杂业务场景,优化多模态文档解析、百亿级向量检索、Rerank 排序模型微调,以及 Long Context 模型的显存与注意力机制优化。
- Agent 智能体及具身/复杂任务规划: 设计并主导开发基于大模型的复杂 Agent 架构(如多智能体协作、记忆机制管理)。提升模型在使用复杂工具(Tool Use)、长逻辑链规划(Planning)及任务分解方面的自洽能力,并推动其在实际业务或智能系统中的规模化落地。
- 高质量数据流与自动化评测体系构建: 从零到一设计 SFT/RL 训练数据的自动化构建、挖掘与清洗 Pipeline。建立贴合业务真实场景的自动化评测集(Benchmark)与 Bad Case 归因体系,驱动模型快速迭代。
任职要求
- 学历与经验背景: 计算机、人工智能、数学等相关专业,硕士及以上学历。具备 3 年左右 AI 算法工作经验,且至少包含 2 年以上的大语言模型(LLM)或多模态大模型(VLM)的一线训练与调优经验。
- 强化学习(RL)核心背景: 拥有扎实的强化学习理论基础,有丰富的 RLHF、DPO、PPO 或其他 LLM 强化对齐算法的实际落地经验。
- 技术栈与框架底座: 熟练掌握 Python 与 PyTorch。深入理解前沿的大模型基座(如 Qwen, Llama3, DeepSeek 等)及多模态架构(如 LLaVA, Qwen-VL 等)。熟悉 DeepSpeed、Megatron 等分布式训练框架,对显存优化(如 ZeRO 系列)有实际操作经验。
- 工程能力与落地导向: 代码基本功扎实,具备优秀的工程实现能力。能够熟练使用 Docker 容器化技术进行算法环境的构建与跨平台部署。
- 优先条件(大流量/高并发): 有亿级用户量产品的大模型落地经验者优先;有具身智能(Embodied AI)、自动驾驶大模型、或复杂系统开源框架贡献经验者优先。
符合京东价值观:客户为先、创新、拼搏、担当、感恩、诚信。
部门
京东科技