AI 基础设施决策框架成本结构

大模型到底跑本地还是走云端?我一年换了三次答案

2026-07-11 · PM Parker · 阅读约 8 分钟

每个自己搭 AI 工作流的人,迟早都会面对这个问题:模型调用走云端 API,还是本地部署?

网上争论很多,立场也很站队。

我自己在这一年里换过三次立场。

最后沉淀下来的答案是一个路由框架——不是二选一,是按任务路由。

我的三次立场变化

第一阶段:"本地只跑生图,文本全部走云。"理由很朴素:早期本地模型的文本质量与云端旗舰差距明显,长上下文业务场景本地根本跑不动;生图场景本地 4090 够用且隐私可控。这个阶段我把"模型质量"当成了唯一变量。

第二阶段:"能本地都本地。"懒猫算力仓的推理节点到位后(128GB 统一内存),我开始把推理服务往本地搬。这个阶段我高估了自己的耐心:调参、排队、显存管理,每个环节都在消耗我。

第三阶段(现在):按任务路由。高质量长文生成走云端旗舰,批量小任务、隐私敏感数据、高频草稿走本地,生图和视频按批量和隐私路由。立场不重要的,路由表才重要。

五维决策框架

单次成本:云端按 token 计费,量小便宜;本地是电费加折旧,量大摊薄。

质量上限:云端旗舰持续更新;本地受算力约束。

隐私边界:云端数据出域;本地数据不出门。

可控性:云端有限流、改版、降级,不由你;本地参数、版本全在你手。

运维负担:云端近零;本地显著且持续。

用法:给具体任务类型逐维打分,而不是给"自己"站队。

同一周里,我的隐私日记走本地小模型,深度长文走云端旗舰,批量图片打标签走本地排队——三者并行不悖。

两个被低估的变量

运维负担是复利债。本地部署的显性成本是硬件,隐性成本是一次次"突然变慢了""显存又爆了""更新把配置覆盖了"的排查时间。这些时间单次不长,但复利累积。我后来给自己立了规矩:每上一个本地服务,先预估它未来每月要吃掉我几小时——超过阈值的,宁可付 API 费。

隐私的价值因任务而异。"数据不出门"对个人日记和商业合同的价值完全不同。我会把任务按敏感度分级:高敏感任务默认本地(哪怕质量略降),公开素材处理优先云端质量。隐私不是全局开关,是路由权重。

给一年级的我一句话

如果回到一年前,我会对那时的自己说:

别问"本地还是云",先把你所有的大模型调用场景列出来,标上量、敏感度、质量要求三个属性——路由表会自己长出来。

本地和云不是敌人,是一个混合架构里各司其职的两层。

真正的问题从来不是站队,是你有没有认真做过这道分配题。

硬件层的分工细节见 算力集群演进记;本地化的运维深度见 自部署的产品思考


← 返回博客列表 · 相关阅读:自部署的产品思考 · 算力集群演进记