24GB 显卡跑 32B 量化模型:vLLM 与 llama.cpp 选型对比
手上有 24GB 显存的 Quadro M6000,想跑 32B 量化模型,该选 vLLM 还是 llama.cpp?本文核实了两套框架的硬件门槛,给出 M6000(Maxwell 架构)上的可行性结论与可复现的编译步骤。
手上有 24GB 显存的 Quadro M6000,想跑 32B 量化模型,该选 vLLM 还是 llama.cpp?本文核实了两套框架的硬件门槛,给出 M6000(Maxwell 架构)上的可行性结论与可复现的编译步骤。