智能算法产品事业部-多模态大模型与Agent算法工程师(内容理解方向)-北京Company TaotianFocus Tech · AlgorithmLocation 北京Published August 26, 2026岗位职责 多模态大模型训练:参与视觉语言模型(VLM)在电商内容场景的持续预训练、SFT 与强化学习(RLHF / GRPO / DPO),提升模型在内容质量评估和细粒度语义理解上的表现。 内容理解 Agent 系统:设计并落地面向内容标签理解的 Agent 系统,包括任务规划、工具调用、多轮推理与自我校验链路,解决单次推理难以覆盖的复杂判定场景。 Agent 强化学习:构建可扩展的评测集与奖励模型(Reward Model),通过在线 / 离线强化学习持续优化 Agent 的决策准确率与稳定性。 业务落地:与产品、运营、工程团队协同,将模型能力沉淀为线上服务,支持质量和语义标签识别,并持续跟踪其在下游推荐场景的实际收益。 任职要求 计算机、人工智能、机器学习、自然语言处理等相关专业硕士及以上学历; 扎实的深度学习基础,熟悉 Transformer / 多模态大模型架构,具备pytorch实际训练调优经验; 具备良好的问题抽象与系统设计能力,能独立完成从问题定义、算法设计到工程落地的全链路闭环; 具有良好的团队合作精神,较强的沟通能力,对工作充满激情,能够主动思考和行动,推进工作顺利实施。 以下经历为加分项 熟悉多模态大模型(MLLM)的训练、微调、对齐(RLHF/DPO/GRPO)流程,有Video-LLM或VLM相关经验者优先; 熟悉强化学习基础理论与实践,有Agent RL训练(PPO、reward modeling、环境设计)相关项目经验者优先; 熟悉LLM-based Agent系统设计(如ReAct、Tool-use、Planning、Multi-Agent),有Agent系统工程化落地经验者优先; 在ACL、CVPR、ICML、NeurIPS、ICLR、EMNLP、MM等顶会发表过相关论文者优先。