大模型平台开发工程师
Company Mihoyo
Focus Tech · Algorithm
Location 上海
Published January 7, 2026
岗位职责
岗位定位 负责模型权重文件训练产出之后的全生命周期管理:从量化/格式转换、模型仓库准入、精度验证、压测性能,到开源/闭源模型上线准入的自动化链路、成本计算;同时承担多算力卡(NVIDIA / AMD / 国产卡)的适配与自动化评测。是连接算法训练产出与推理 Serving 之间的"模型入口守门人"。
主要职责
-
模型权重全生命周期管理:接收训练 ckpt(Megatron/DeepSpeed/FSDP)→ 合并/转换为统一发布格式(HF safetensors)→ 校验(checksum/安全扫描)→ 分层存储与 GC → 版本与血缘(训练→ckpt→转换→量化→评测→部署)
-
量化与格式转换:HF → TRT-LLM / vLLM / SGLang / ONNX;FP8/INT8/INT4 量化(GPTQ/AWQ/SmoothQuant);转换后数值 diff 与精度对齐
-
模型仓库准入:Model Hub/Registry(目录/版本/别名/RBAC),准入标准(元数据/必交文件/安全/license/精度/性能门禁),输出认证报告
-
精度验证与压测性能:逐层数值对齐 + 通用/业务评测集 + 精度回归门禁;benchmark(TTFT/TPOT/吞吐/显存/MFU)+ 性能基线 + perf 回归
-
上线准入自动化链路(CI/CD for Model):开源模型自动接入(拉取→扫描→转换→精度→压测→认证→入库);闭源/API 模型接入(协议/效果/延迟/成本/fallback/灰度);Pipeline-as-Code(Argo/Airflow/Jenkins)
-
成本计算:cost per token 建模(GPU 单价 ÷ 实测吞吐),输出卡型×精度×并行的成本矩阵,支撑硬件选型
-
多算力卡适配与自动化评测:NVIDIA(CUDA/TRT-LLM)、AMD(ROCm/vLLM)、国产卡(昇腾 CANN/MindIE、寒武纪 Neuware、海光 DCU);多卡 CI 矩阵自动跑精度+性能评测,输出支持度矩阵与对比报告,推动问题闭环
-
CI/Workflow 与 K8s:基于 K8s Job/Pipeline 做任务调度与资源治理(GPU quota/镜像/队列),流程平台化与可观测
任职要求
必须满足(硬性):
- 计算机相关本科+,3 年+ 模型平台/推理优化/MLOps(硕士 2 年+)
- 实操过量化与格式转换:FP8/INT8/INT4(GPTQ/AWQ),HF → TRT-LLM/vLLM/SGLang/ONNX,并能做转换后数值/精度验证
- 实操过精度评测与压测:搭建过评测集/流水线,用过 lm-eval-harness / vLLM bench / TRT-LLM benchmark,理解 TTFT/TPOT/吞吐/MFU
- 有模型上线准入的 CI/CD 自动化流水线经验(Argo/Airflow/Jenkins/GitLab CI 任一)
- 熟悉 K8s,有基于 K8s 的任务/流水线运行与排障
- 熟悉至少一种推理引擎(vLLM/TRT-LLM/SGLang/TGI)原理与使用,懂 GPU(CUDA/显存/并行)
- 熟练 Python(必须),了解 C++/Go,有 PyTorch/HF Transformers 经验