【Plan A】递归自我改进(RSI)方向-27届
Campus
Company Antgroup
Focus Tech · Other
Location 北京, 上海, 杭州
Published September 3, 2026
岗位职责
研究智能系统如何利用任务结果、环境反馈和评测信号,持续优化推理策略、记忆机制、Agent Harness 与训练数据,并进一步演化任务生成、能力诊断、验证信号和优化策略,以跨代能力增益、分布外泛化、非退化约束和单位计算收益为标准,探索可验证、可持续的 Recursive Self-Improvement。
任职要求
- 理论基础扎实:深厚的深度学习与优化理论功底,能从第一性原理建模问题;
- 架构深入理解:熟悉 Transformer、MoE 及主流大模型底层实现;
- 精通后训练范式:SFT、RLHF/DPO/PPO 等对齐算法,理解 Alignment 原理与挑战;
- Agentic 实战经验:具备复杂 Agentic 系统(Tool-use / Reasoning / Planning)的训练与搭建经验;
- 科学实验素养:能独立设计实验、严谨验证,在复杂工程约束下做出算法决策。
加分项:
- 顶会论文发表或高水平竞赛金牌;
- MoE 或新型 Attention 设计经验;
- 长上下文(100K+)训练经验;
- 100B+ 参数规模模型训练经验;
- 数据分布建模与 Scaling 经验。
特色标签
100K上下文、DPO、OOD泛化、PPO、Python、RLHF、Self-Attention模型、Shell、Sparse MoE、专家路由网络、云服务、云计算、人类反馈强化学习、代理系统、分布式计算、分布式训练、参加算法相关竞赛/获奖、发表算法相关优秀论文、变换器、域外迁移、大数据处理工具(Spark/Hadoop/Hive)、大模型算法、强化学习、推理机制、推理算法、推理路径、推荐、智能体、智能体引擎、智能体框架、有留学背景、模型加速/性能优化、模型扩容、注意力架构、深度学习、混合专家模型、研发效能、算力缩放、能力保持约束、自循环优化、自我演化、自提升智能、自然语言处理算法、营销、规模扩展、超长序列、跨域适应、长程依赖训练、防退化限制、非衰退边界