AI Infra架构师 (JR20260814005)Company DidiFocus Tech · AlgorithmLocation 北京Published August 14, 2026岗位职责 职位描述 AI Infra 整体架构设计:作为 Fintech AI Infra 的技术方向负责人,主导整体架构蓝图的设计与演进,覆盖模型推理服务层、Agent 运行时层(Gateway/Sandbox)、底层算力,结合Fintech的业务实际落地。 Agent Infra 架构:集合集团AI 平台能力,设计 Agent Gateway(模型路由、权限、限流、审计、Token 成本控制)、Agent Sandbox的整体方案,推动 AI Infra 组件(网关、Sandbox、可观测等)的落地演进。 推理架构:设计自建 GPU 推理集群与云厂商 API 并行的双供给线架构,建设 KV Cache 管理系统(迁移/共享/淘汰策略)与模型分发体系,跟进量化、投机采样等优化技术落地;定义推理分流原则,统一通过 AI Gateway 接入。 GPU 容量规划与算力治理:建立 GPU 容量模型与规划机制,落地算力池化、在离线混布、GPU 超卖、潮汐资源拆借与 Quota 管理等治理手段;考虑机柜电力、网络互联等硬约束,保证GPU资源满足业务需求。 稳定性与容灾治理:把故障定位、隔离、快速恢复与多机房容灾作为 AI Infra 架构的显式设计维度,对齐金融级 SLA 目标;推动推理服务与 Agent 平台的高可用能力建设(容灾演练、降级策略、自动容灾)。 跨团队协同:作为 Fintech AI Infra 技术代表,与业务线 AI 团队、集团 AI 平台、基础平台、机房/网络等部门做方案级对接;推动AI Infra 组件研发、稳定性保障、模型部署等方向同事的工作。 任职要求 5 年以上基础架构或平台架构经验,本科及以上学历,计算机相关专业;2 年以上大模型推理平台 / Agent Infra / AI 平台方向架构经验。 理解大模型推理架构:vLLM / SGLang / TensorRT-LLM 等推理引擎,PD 分离、KV Cache 管理、Continuous Batching、量化;有自建 GPU 推理集群的实战经验。 熟悉 Agent 技术栈:Agent 框架(LangChain/LangGraph 等)、Function Calling、MCP 协议、RAG、Agent 评测(Eval)体系。 熟悉 GPU 集群与云原生:NVIDIA GPU 生态、InfiniBand/RoCE 高速网络、Kubernetes GPU 调度、机房电力与网络约束;能借助 Nsight 等工具独立完成 GPU 性能瓶颈分析。 强 Owner 意识和全局视角,能从业务场景出发定义 AI Infra 的架构问题;具备跨团队推动落地的能力;积极拥抱 AI 辅助编程工具提升研发效率。 部门 Fintech Technology