微信WeLM-大模型研发基础设施工程师-研发效能方向(深圳、上海、广州)Company TencentFocus Tech · AlgorithmLocation 北京Published August 12, 2026岗位职责 面向研发迭代过程中的典型负载优化调度、路由、部署策略,优化系统吞吐和稳定性; 建设并运营面向模型研发的沙箱 CPU 集群与工具执行环境,负责环境隔离、任务编排、资源调度与运行治理,保障评估和实验任务稳定执行; 建设并运营 GPU 集群、Kubernetes 和数据系统,提升资源利用率、任务吞吐和端到端研发效率; 负责研发生产系统的 SLA、可观测性与故障恢复,定位性能瓶颈和异常波动,保障关键任务与评估结果稳定、可复现、可诊断; 与算法、评估和推理基础设施团队共同定义真实研发负载,持续演进面向前沿模型迭代的系统能力。 任职要求 具备扎实的分布式系统或 ML Systems 经验,能够设计和维护持续运行的大规模生产系统; 熟悉任务调度、工作流系统、容器或沙箱、Kubernetes、存储、消息系统以及可观测性中的一个或多个领域; 对大模型训练、推理、评测、合成数据或强化学习 Rollout 有实际经验或强烈兴趣; 能够同时关注系统可靠性与研究正确性,理解“系统成功运行”和“产生可信模型结论”之间的差异; 乐于深入模型研发现场,理解研究工作流,并将快速变化的实验需求抽象为可靠、可复用的系统能力; 希望自己的系统工作直接影响前沿模型的数据、评估和训练迭代,而不仅仅是优化一般软件开发流程。 产品/项目 WXG公共 工作年限 两年以上工作经验