jdwatch
  • Home
  • CLI
  • Skills
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

微信WeLM-大模型研发基础设施工程师-研发效能方向(深圳、上海、广州)

Company Tencent

Focus Tech · Algorithm

Location 北京

Published August 12, 2026

岗位职责

  1. 面向研发迭代过程中的典型负载优化调度、路由、部署策略,优化系统吞吐和稳定性;
  2. 建设并运营面向模型研发的沙箱 CPU 集群与工具执行环境,负责环境隔离、任务编排、资源调度与运行治理,保障评估和实验任务稳定执行;
  3. 建设并运营 GPU 集群、Kubernetes 和数据系统,提升资源利用率、任务吞吐和端到端研发效率;
  4. 负责研发生产系统的 SLA、可观测性与故障恢复,定位性能瓶颈和异常波动,保障关键任务与评估结果稳定、可复现、可诊断;
  5. 与算法、评估和推理基础设施团队共同定义真实研发负载,持续演进面向前沿模型迭代的系统能力。

任职要求

  1. 具备扎实的分布式系统或 ML Systems 经验,能够设计和维护持续运行的大规模生产系统;
  2. 熟悉任务调度、工作流系统、容器或沙箱、Kubernetes、存储、消息系统以及可观测性中的一个或多个领域;
  3. 对大模型训练、推理、评测、合成数据或强化学习 Rollout 有实际经验或强烈兴趣;
  4. 能够同时关注系统可靠性与研究正确性,理解“系统成功运行”和“产生可信模型结论”之间的差异;
  5. 乐于深入模型研发现场,理解研究工作流,并将快速变化的实验需求抽象为可靠、可复用的系统能力;
  6. 希望自己的系统工作直接影响前沿模型的数据、评估和训练迭代,而不仅仅是优化一般软件开发流程。

产品/项目

WXG公共

工作年限

两年以上工作经验