基准测试硬件选型AI 生图

4090 大战 Jetson Thor:同 seed 生图,差距没想到

2026-08-09 · PM Parker · 阅读约 8 分钟

我家里有两台能跑 AI 生图的设备。

一台是 4090 主机(i9-14900K + 24GB 显存,跑原生 PyTorch,torch.compile 加 fp16 优化)。

一台是懒猫 AI Pod(Jetson Thor T5000,128GB 统一内存,跑 stable-diffusion.cpp 的 C++ 推理 + GGUF 量化,CPU-GPU 按层调度)。

两边都用 z-image-turbo 模型出图。

到底谁快?快多少?网上没有答案——这个组合太非主流了。

所以我决定自己测。

测试设计:把变量摁死

8 月 9 号,我设计了一组对照实验。

同提示词、同随机种子——生成内容一致,排除内容复杂度干扰。

两组分辨率:512×512 和 1024×1024。

三档推理步数:4、7、9 步。

每种组合跑 5 次取均值,记录预热耗时。

结果:一个持平,一个 3.5 倍

512×512:两者持平,都是 7.4 秒左右。

1024×1024:4090 平均 10.9 秒(含 2 秒预加载),Thor 固定 38.6 秒。

3.5 倍的差距。

但真正有意思的是第三个发现。

Thor 的耗时完全不随步数变化——4 步、7 步、9 步,都是 38.6 秒。

步数翻倍,耗时不变。

这说明什么?它的瓶颈根本不在推理计算本身,而在框架的固定开销——调度、搬运、解压。"耗时与工作量无关"是指认瓶颈位置的免费指纹。

为什么 512 持平、1024 拉开?

低分辨率时计算量小,两台设备的瓶颈都不在算力,所以持平。

高分辨率时计算量暴涨,4090 的原生 PyTorch 算子库和编译优化的吞吐优势显现出来;而 Thor 的 GGUF 量化在解压和 CPU-GPU 按层调度上的开销被同步放大。

"在哪个区间会拉开差距",比"平均差多少"更接近选型真相。均值会撒谎,边界条件不会。

顺手算了笔成本账

按电费和硬件折旧折算单张图:4090 约 0.024 元,Thor 约 0.037 元。

有差距,但绝对值都低到可以忽略。

如果只看速度和成本,结论会很粗暴。

但选型还有第三个维度:调用性质。

最有价值的结论:各自的角色

测完我给两台设备重划了分工,这才是这次测试真正的产出。

4090 = 生产力主力。快、成本低、软件生态成熟,承担一切创作性出图。

Thor = 弹性兜底。速度不是它的卖点。它的卖点是零调用限制,加上与主力机资源完全隔离——主力机排队时、需要大批量粗筛出图时,它就是无限的余量池。

基准测试最好的输出,不是"谁赢了",是每个选手该被安排在什么位置。

速度榜冠军不一定是你的生产力,输家可能恰恰是你缺的那块拼图。

方法论小结三条:控制变量要狠(同种子同提示词锁死内容);找"完全不敏感"的异常维度——它直接暴露瓶颈位置;结论落到角色分配,不落到排行榜。

集群的全景分工见 算力集群演进记;GPU 任务的调度纪律见 OOM 四张面孔


← 返回博客列表 · 相关阅读:算力集群演进记 · OOM 四张面孔