AI 本地部署
2026-10-06
AI 本地部署
2026-10-07
24GB 显卡跑 32B 量化模型:vLLM 与 llama.cpp 选型对比
手上有 24GB 显存的 Quadro M6000,想跑 32B 量化模型,该选 vLLM 还是 llama.cpp?本文核实了两套框架的硬…
阅读全文 →



