客服算法AI赔付工程师/专家
Campus/Intern
Company 得物
Focus 技术 · 算法
Remote / Anywhere
June 1, 2026
岗位职责
职位描述: 1、构建 Uplift Model(R/X-Learner),从“反事实”视角量化赔付策略对 GMV/留存/用户满意度的绝对增量,拒绝无效补贴。 2、负责大模型在纠纷场景下的 SFT与 RLHF,运用 GRPO、DPO 等算法提升模型对复杂平台规则的逻辑推演能力。探索 CoT与 PRM 技术,确保模型在定责与赔付建议上的高度一致性与可解释 3、强化学习:探索 Agent 架构与过程奖励模型,在动态博弈环境下优化赔付路径,实现长期 ROI 最大化。
任职要求
职位要求 1、学历背景:硕士及以上学历,计算机、人工智能、信号处理、模式识别等相关专业,优秀本科生可放宽条件; 2、熟悉机器学习常用算法模型原理,有一定的实践经验,包括但不限于LR,XGB,S-learner,X-learner、uplift tree等; 3、具备 NLP / CV 技术应用经验,包括但不限于语义分析、检索模型、知识库构建、视觉大模型、多模态大模型等; 编程能力: 4、熟练掌握 Python/C++/Java 等至少一门编程语言; 5、有扎实的算法基础和代码实现能力,能独立完成复杂系统开发;
加分项: 1、深入理解强化学习的核心算法(如 PPO、DPO、GRPO)以及常用框架(ray、verl、openrlhf),有相关项目实践经验; 2、有个性化优惠券、智能补贴、push算法、智能投放等领域经验者优 3、在顶级会议(如 ACL、NeurIPS、ICLR 等)发表过相关论文,或高水平竞赛取得优秀名次;