【快Star】多模态生成模型计算效率优化工程师-【可灵AI】InternCompany KuaishouFocus Tech · AlgorithmLocation 上海, 北京Published August 12, 2026岗位职责 高效Attention设计: 探索新一代注意力实现机制, 包括但不限于: Sparse/Quant-Attention, Linear-Attention, Mamba等, 破除 Attention 计算平方复杂度限制, 推进新一代大模型推理极限; 量化加速: 探索NV-FP4 / INT4 等低bit 精度的量化后训练(QAT) 和KV-cache 压缩, 优化模型计算效率的同时保证模型的效果无损; 投机推理: 致力于提升Auto-Regressive 模型的生成效率, 利用draft-verify 机制实现低成本token 生成,追求极致的接收率和突破更高的接收长度。 任职要求 硕士及以上学历,数学、计算机、自动化、电子等专业优先; 熟悉Transformer结构及其变种, 熟悉Attention的设计和多种变种实现, 熟练使用Triton / TileLang 等工具; 数理要求: 熟练掌握 线性代数, 概率率和矩阵论; 有较强的自驱力和学习力,对生成式模型有强烈的兴趣; 加分项: 有 NIPS/ICLR/ICML/CVPR 等顶会发表经历者优先。