可观测性SRE(大模型)

Company Mihoyo

Focus Tech · Algorithm

Location 上海

Published January 7, 2026

岗位职责

  1. 公司、集群、公有云三层可观测性系统(日志、监控、Trace、告警)的研发、部署、运维

  2. 超大规模 GPU 训练集群的指标、日志、Trace 采集与查询性能优化(百万级 series、TB / 日 日志)

  3. 多租户用户侧 Dashboard 与查询界面的开发,搜索性能调优

  4. 训练任务级监控接入(step time、loss、GPU SM/Mem 利用率、通信带宽)

  5. RDMA 监控指标接入(PFC pause、ECN mark、QP 状态、HCA counter)

  6. 与 NOC、运维协作沉淀告警标准、降噪、SOP

任职要求

  • 本科及以上,3 年以上 SRE / 可观测性平台研发经验
  • 精通 Prometheus / VictoriaMetrics / Thanos 至少一个,有大规模联邦或分片治理经验
  • 熟悉 Loki / Elasticsearch / ClickHouse 至少一个,有 TB 级日志写入与查询调优经验
  • 熟悉 Grafana 二次开发;前端基础(React / Vue)加分
  • 熟悉 OpenTelemetry / Jaeger Trace 协议
  • Go / Python 至少一种,能独立完成中等规模平台研发