AI 本地部署 用 Ollama 在 PVE 虚拟机里跑本地大模型:显卡直通与显存规划 作者moonandsky 2026年10月6日2026年10月6日 在 PVE 上给虚拟机直通一块显卡的完整流程:IOMMU 开启、vfio 绑定、驱动分支避坑,再按显存容量规划 7B~32B 量化模型与 KV cache,最后用 Ollama 跑通验收。