可观测性SRE(大模型)
Company Mihoyo
Focus Tech · Algorithm
Location 上海
Published January 7, 2026
岗位职责
-
公司、集群、公有云三层可观测性系统(日志、监控、Trace、告警)的研发、部署、运维
-
超大规模 GPU 训练集群的指标、日志、Trace 采集与查询性能优化(百万级 series、TB / 日 日志)
-
多租户用户侧 Dashboard 与查询界面的开发,搜索性能调优
-
训练任务级监控接入(step time、loss、GPU SM/Mem 利用率、通信带宽)
-
RDMA 监控指标接入(PFC pause、ECN mark、QP 状态、HCA counter)
-
与 NOC、运维协作沉淀告警标准、降噪、SOP
任职要求
- 本科及以上,3 年以上 SRE / 可观测性平台研发经验
- 精通 Prometheus / VictoriaMetrics / Thanos 至少一个,有大规模联邦或分片治理经验
- 熟悉 Loki / Elasticsearch / ClickHouse 至少一个,有 TB 级日志写入与查询调优经验
- 熟悉 Grafana 二次开发;前端基础(React / Vue)加分
- 熟悉 OpenTelemetry / Jaeger Trace 协议
- Go / Python 至少一种,能独立完成中等规模平台研发