大模型平台开发工程师

Company Mihoyo

Focus Tech · Algorithm

Location 上海

Published January 7, 2026

岗位职责

岗位定位 负责模型权重文件训练产出之后的全生命周期管理:从量化/格式转换、模型仓库准入、精度验证、压测性能,到开源/闭源模型上线准入的自动化链路、成本计算;同时承担多算力卡(NVIDIA / AMD / 国产卡)的适配与自动化评测。是连接算法训练产出与推理 Serving 之间的"模型入口守门人"。

主要职责

  1. 模型权重全生命周期管理:接收训练 ckpt(Megatron/DeepSpeed/FSDP)→ 合并/转换为统一发布格式(HF safetensors)→ 校验(checksum/安全扫描)→ 分层存储与 GC → 版本与血缘(训练→ckpt→转换→量化→评测→部署)

  2. 量化与格式转换:HF → TRT-LLM / vLLM / SGLang / ONNX;FP8/INT8/INT4 量化(GPTQ/AWQ/SmoothQuant);转换后数值 diff 与精度对齐

  3. 模型仓库准入:Model Hub/Registry(目录/版本/别名/RBAC),准入标准(元数据/必交文件/安全/license/精度/性能门禁),输出认证报告

  4. 精度验证与压测性能:逐层数值对齐 + 通用/业务评测集 + 精度回归门禁;benchmark(TTFT/TPOT/吞吐/显存/MFU)+ 性能基线 + perf 回归

  5. 上线准入自动化链路(CI/CD for Model):开源模型自动接入(拉取→扫描→转换→精度→压测→认证→入库);闭源/API 模型接入(协议/效果/延迟/成本/fallback/灰度);Pipeline-as-Code(Argo/Airflow/Jenkins)

  6. 成本计算:cost per token 建模(GPU 单价 ÷ 实测吞吐),输出卡型×精度×并行的成本矩阵,支撑硬件选型

  7. 多算力卡适配与自动化评测:NVIDIA(CUDA/TRT-LLM)、AMD(ROCm/vLLM)、国产卡(昇腾 CANN/MindIE、寒武纪 Neuware、海光 DCU);多卡 CI 矩阵自动跑精度+性能评测,输出支持度矩阵与对比报告,推动问题闭环

  8. CI/Workflow 与 K8s:基于 K8s Job/Pipeline 做任务调度与资源治理(GPU quota/镜像/队列),流程平台化与可观测

任职要求

必须满足(硬性):

  • 计算机相关本科+,3 年+ 模型平台/推理优化/MLOps(硕士 2 年+)
  • 实操过量化与格式转换:FP8/INT8/INT4(GPTQ/AWQ),HF → TRT-LLM/vLLM/SGLang/ONNX,并能做转换后数值/精度验证
  • 实操过精度评测与压测:搭建过评测集/流水线,用过 lm-eval-harness / vLLM bench / TRT-LLM benchmark,理解 TTFT/TPOT/吞吐/MFU
  • 有模型上线准入的 CI/CD 自动化流水线经验(Argo/Airflow/Jenkins/GitLab CI 任一)
  • 熟悉 K8s,有基于 K8s 的任务/流水线运行与排障
  • 熟悉至少一种推理引擎(vLLM/TRT-LLM/SGLang/TGI)原理与使用,懂 GPU(CUDA/显存/并行)
  • 熟练 Python(必须),了解 C++/Go,有 PyTorch/HF Transformers 经验