推理是模型上线后最贵的环节。一个未经优化的 70B 模型推理服务,成本可能比优化后高出 5-10 倍。本文系统梳理大模型推理优化的四大核心技术,带你从原理到实践全面掌握。
一、推理优化的全局视角
大模型推理的核心瓶颈是 内存带宽,而非计算能力。理解这一点是所有优化的起点。
推理瓶颈分析:
┌─────────────────────────────────────────────────────────────┐
│ 推理过程两阶段 │
│ │
│ 阶段1: Prefill(预填充) │
│ ┌──────────────────────────────────────────┐ │
│ │ 输入所有 prompt tokens → 并行计算 │ │
│ │ 特点: 计算密集型 (compute-bound) │ │
│ │ 速度: 较快(可并行) │ │
│ └──────────────────────────────────────────┘ │
│ ↓ │
│ 阶段2: Decode(自回归解码) │
│ ┌──────────────────────────────────────────┐ │
│ │ 逐个 token 生成 → 串行计算 │ │
│ │ 特点: 内存带宽密集型 (memory-bound) │ │
│ │ 速度: 较慢(不可并行) │ │
│ │ 瓶颈: 每步都要读取全部 KV Cache │ │
│ └──────────────────────────────────────────┘ │
└─────────────────────────────────────────────────────────────┘
2026/7/3大约 18 分钟