模型推理(Inference)(2026.08.25)

概念编号:075

一句话理解

Inference 是“模型已经训练好之后,拿它来处理一次输入并得到输出”。

具体解释

模型推理包括读取输入、转换为 Token 或其他表示、执行参数计算、预测输出概率,并通过解码生成最终结果。API 调用、聊天回复和本地运行模型,都属于推理过程。

边界与易混淆概念

  • Inference 不等于 Reasoning:Inference 是所有模型运行的总过程;Reasoning 是解决复杂问题时的推导能力。
  • 推理不等于训练:训练调整参数,推理使用已有参数。
  • 推理速度不等于回答质量:延迟、吞吐、成本和质量需要分别评估。

例子

你向 ChatGPT 发送一句话后,服务端调用模型计算并返回答案,就是一次推理请求。

相关概念

来源

概念卡更新日志

  • 2026.08.25|创建概念卡:为区分 Inference 与已有 Reasoning 概念,依据 AI 概念框架登记为 075