组装了一块 32GB 巨大显卡跑本地大模型

目录

大家好,我是罗孚,一位 AI 爱好者。

今天给大家介绍一下我的 32GB 巨大显卡。

眼见为实的巨大显卡

显卡,32GB,还巨大。没错,真的巨大。不信?你看:

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-01.webp

上面是显卡,下面是 HP Z4G4 工作站。它们之间通过 8654 交叉线连接:

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-02.webp

不得不说,尺寸确实相当巨大。完整尺寸如下:

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-03.webp

是的,这实际上是一块安装在机箱里的显卡,内部由两块 SXM2 V100 显卡组成。

巨大显卡详细介绍

好吧,下面详细介绍一下这块巨大显卡。

正如前面所说,它实际是由两块 SXM2 版 V100 显卡组成的。

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-04.webp

然后再连接到转接底板上:

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-05.webp

再加上两块 x16 转接卡,就可以组成这块“巨大显卡”了。

它的原理基本就是这样。不过,真正需要购买的东西还比较多:

显卡 2 块:NVIDIA Tesla SXM2 版 V100 16GB

转接主板 1 张 + 转接卡 2 块:算是显卡主板

8654 交叉线 4 根:用来连接显卡和主机 PCIe

SXM2 原装散热器 2 个:主要散热设备

显卡机箱 1 个:用来安装这块巨大显卡

1850W 电源 1 个:提供充足供电

12×12 小风扇 5 个:用于机箱和显卡周边散热

基本就是这些,准备好之后就可以开始组装了。

散热器和小风扇:

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-06.webp

显卡主角:

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-07.webp

主板前面已经拍过,机箱、电源等部件在后面的组装过程中都会看到。

动手组装巨大显卡

讲完原理,下面就亲手组装一下这块巨大显卡。

没有专门拍全家福,但上面列出的东西一件都没有少。

第一步:将 SXM2 V100 显卡安装到显卡主板上

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-08.webp

由于主板就是为 SXM2 显卡设计的,安装非常容易,拧上螺丝就行,基本属于无缝安装。

可以看到背面的螺丝情况:

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-09.webp

第二步:贴上散热片

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-10.webp

这一步是我额外加的。

主要原因是,我觉得散热器和显卡之间的间隙也应该增加一些散热措施,同时也算是给晶体管多一层保护。于是,我把硅胶片和散热片堆满显卡两边,高度与显卡基本持平。这样做之后,我心里会更踏实一些。

第三步:装上原装散热器和风扇

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-11.webp

这款原装散热器确实大得吓人。我买的应该算是比较高的版本,没有选择矮款。

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-12.webp

最终看起来效果还不错。主体部分基本完成,最重要的显卡也终于显露出了它巨大的一面。

不过,仅仅这样装完还不够。

如此巨大的散热器不能只依靠被动散热,还需要风扇从散热器的缝隙中送风,才能真正把热量带走。否则,热量会积在机箱内部,这显然不能接受。

所以,我在前后各安装了两个风扇,合计四个,整体散热风道也就基本清晰了。

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-13.webp

务必注意风扇的出风方向。四个风扇需要朝向同一个方向吹,这样才能真正形成有效的散热风道。

第四步:给主板接上电源

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-14.webp

这一步需要把电源上的大电源 PIN,以及显卡所需的电源 PIN 等,全部插到主板上。

到这里,电源部分基本就完成了。

第五步:在电脑上安装转接卡

接下来是在目标电脑上的安装,需要安装两块 PCIe 卡:

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-15.webp

电脑主板至少需要带有两个 x16 PCIe 插槽。虽然 x8 也可以使用,但条件允许的话,尽量选择双 x16。

当然,如果 CPU 不带核显,还需要额外占用一个显卡插槽来连接显示器。

我的 Z4G4 就需要额外安装一块显卡。上图最下面那块 HD7750,就是用来连接显示器的显卡,只负责显示,不参与算力计算。我特意买了一块 AMD 显卡来承担这个任务。

第六步:接上 8654 转接线

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-16.webp

就是这些长长的线,一共四根,接起来并不复杂,但需要注意它们是交叉连接的,具体如下图:

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-17.webp

完成连接后,基本就可以上电检查了。

第七步:上电检查

正式装进机箱前,先进行一次上电检查。

注意:主板角落里有两个开关。一个用于 AT 和 MT 模式切换,另一个用于控制电源上电。

AT 模式会跟随电脑一起上电,MT 模式则是手动上电。一般建议使用 AT 模式即可。对于一台常年开机的设备来说,通常不需要频繁操作这两个开关。

先进入 Ubuntu 检查:

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-18.webp

Ubuntu 24 下的驱动比较成熟,安装完成后基本就能识别。两块显卡合计 32GB 显存,已经正常显示出来了。

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-19.webp

nvtop 的显示也比较正常。

接着进入 Windows 检查:

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-20.webp

Windows 下同样能够识别两块显卡,但因为没有安装驱动,所以暂时无法直接使用。

我主要在 Ubuntu 下使用,因此没有继续处理 Windows 驱动。不过既然硬件已经能够识别,原则上应该可以安装对应驱动。

上电检查完成,32GB 显卡可以正常使用。接下来下电,准备装箱,把它真正做成一块“巨大显卡”。

第八步:将显卡装进机箱

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-21.webp

下电之后,基本就可以把显卡装进机箱了。机箱尺寸是标准的,主板直接拧螺丝固定即可。

我买的 1850W 电源有点大,供电肯定没有问题,但安装时确实比较费劲。大家后续选择电源时,务必注意电源与机箱的匹配程度,电源不宜太长。

另外,由于显卡散热器尺寸较大,再加上 12×12 风扇后似乎无法完全放下,最终只能去掉靠近机箱后部的两个风扇。

不过,由于风是从内部向外吹,整体散热仍然可以接受。后续如果需要,还可以再买两个更薄的 12×12 风扇装进去。

既然两个散热器无法安装在机箱尾部,那我就把它们直接装到机箱前部,给整个机箱散热,这也是一个不错的方案:

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-22.webp

盖上前面板之后,竟然一点也看不出来。

而且面板本身就是孔状结构,风可以直接穿透,完全没有问题。

后来我又发现机箱后面还可以再安装一个风扇,于是又在外面加装了一个。这样一来,整个风道就更加完整了:前面进风,后面排风,理论上已经足够散热。

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-23.webp

好了,至此,32GB 巨大显卡正式安装完毕。

确实有点太大了,我就不继续给大家展示了。

大模型测试

费劲组装这块 32GB 巨大显卡,最终当然是为了在本地运行大模型。

下面简单测试一下:

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-24.webp

35B 的千问,能够跑出 62 tokens/s 的速度,确实让人有些惊喜。

总体来说,还是相当令人满意的。

显卡之外的考虑

成本

这块巨大显卡的购买和组装,实际是在 2025 年 618 前后完成的。

现在已经过去一年多了,我才写下这篇文章,似乎有点过时。毕竟大模型更新得实在太快,而且现在似乎也不再像以前那样流行自建大模型。

除非确实存在本地部署的必要,否则很多人可能并没有特别强烈的意愿,包括我自己在内,实际使用场景也不算太多。

但是,不到 100 元/GB 的成本,大家是否愿意接受呢?

现在无论是购买一块 32GB 显存的显卡,还是租用一台拥有 32GB 显存的服务器,价格都不算便宜。如果自己拥有一块 32GB 显存的显卡,成本不到 100 元/GB,是否值得?

这个问题,可能每个人都会有不同答案。

我个人认为,如果确实有自建大模型的需求,这块显卡是值得的。

如果是为了进行大模型研究,需要反复折腾各种模型,那么用不高的价格获得 32GB 显存,自己动手玩一玩,同样是值得的。

不知道屏幕前的你怎么看?欢迎与我联系交流。

电费

上面说的是一次性的显性成本,隐性成本同样不小,这就是电费。

显卡的耗电量,大家应该都有所了解。这块巨大显卡在运行大模型时,大概会消耗多少电呢?

我抓拍了一次运行大模型时的较高功率值:

/llm/dual-v100-local-llm/static/giant-gpu-local-llm-25.webp

这意味着,如果一直运行大模型,大约两三个小时就要消耗一度电。一天下来,可能要消耗 10 度电左右。

按照电费计算,一天少则 5 元,多则 10 元。

这样的成本放在公司里可能问题不大,但对于个人长时间运行来说,确实需要认真考虑。

是否会被这样的电费吓退,也许同样取决于每个人的使用场景。

模型的选择

基于当前的模型发展情况,对于本地 32GB 显存的设备来说,什么样的模型比较合适?

一般来说,27B~36B 左右的模型比较合适,17B 左右的 Flash 模型也是不错的选择。

虽然模型进步得非常快,每一次更新都在不断超越上一代,但模型本身也在持续变大,小 B 模型越来越少,个人自行部署的可能性也越来越低。

不过,我还是很怀念过年前后的那段时间。

那时候我正在研究“龙虾”,也就是 openclaw。当时使用的是 glm-4.7-flash 模型,不仅速度快,智能化程度也完全够用。

所以,我个人比较感兴趣的模型可能是下面这些:

glm-4.7-flash:q4_K_M

qwen3.8:27b

gemma4:31b

这些模型的显存占用都在 20GB 左右,剩余显存正好可以用于缓存,整体上会相对宽裕一些。

预计我会按照这个方向进行部署。

屏幕前的你,对于 32GB 显存的设备有什么模型推荐呢?欢迎留言交流。

好了,这块真正巨大的显卡就介绍到这里。

整个过程体现了罗孚超凡的组装能力。

当然,这是开玩笑的。

不过,罗孚确实认为,部署 20GB 左右显存占用的模型,自己 DIY 玩一玩,还是很有意思的。

你是否也对这种低成本、高显存的显卡感兴趣?

欢迎和我一起交流。

发现新版本

当前站点有新版本可用。