独立开发者做 AI 应用,部署方案选错了就是持续失血。VPS 按月固定付费,闲时浪费、忙时不够;自建 GPU 服务器门槛太高,一台 4090 就吃掉半年预算。Cloudflare Workers AI 给了第三条路:serverless GPU,按用量付费,50 多个开源模型直接调用。
但”按用量付费”到底花多少,大部分人心里没数。这篇基于 Cloudflare 官方定价文档,把成本拆到每一个请求,帮你做架构选型时少踩坑。
Workers AI 的计费逻辑:Neuron 是什么
Cloudflare 不按 token 计费,也不按请求次数计费。它发明了一个单位叫 Neuron,表示”GPU 跑一次推理需要的计算量”。
根据 2026 年 10 月官方文档,定价很简洁:
- Workers Free 计划:每天 10,000 Neurons 免费
- Workers Paid 计划($5/月):每天 10,000 Neurons 免费,超出部分 $0.011 / 1,000 Neurons
关键点是:不同模型消耗的 Neurons 差异巨大。Llama 3.2 1B 每百万输入 token 消耗 2,457 Neurons,而 Llama 3.2 11B Vision 每百万输出 token 消耗 61,493 Neurons。差了 25 倍。
这意味着模型选型直接决定你的账单厚度。
三种典型架构的成本对比
假设你要做一个 AI 写作助手,日均 500 次请求,每次请求平均 1,500 输入 token + 500 输出 token。看三种方案的月成本。
方案一:Llama 3.2 1B(轻量模型)
输入:500 × 1500 = 750,000 token/天 → 1,843 Neurons
输出:500 × 500 = 250,000 token/天 → 4,563 Neurons
日均合计:6,406 Neurons → 在免费额度内
月成本:$0(完全落在每天 10,000 Neurons 的免费额度里)
适用场景:简单分类、短文本摘要、基础问答。1B 参数的模型能力有限,但够做轻量任务。
方案二:Llama 3.1 8B(中等模型)
输入:750,000 token → 3,089 Neurons
输出:250,000 token → 8,717 Neurons
日均合计:11,806 Neurons → 超出免费额度 1,806 Neurons
月成本:$5(基础订阅)+ 超出部分约 $0.60 = $5.60/月
适用场景:内容生成、多轮对话、代码补全。8B 是性价比甜点,能力够用、成本可控。
方案三:Llama 3.2 11B Vision(视觉模型)
输入:750,000 token → 3,308 Neurons
输出:250,000 token → 15,373 Neurons
日均合计:18,681 Neurons → 超出免费额度 8,681 Neurons
月成本:$5 + 超出部分约 $2.87 = $7.87/月
适用场景:图文混合理解、OCR 辅助、图像描述生成。视觉模型 Neuron 消耗高,但比调 GPT-4o 便宜一个量级。
架构选型的三个判断
第一,先测免费额度能不能兜住你的核心场景。 Workers Free 每天 10,000 Neurons,对小规模验证足够。一个日均 200 请求的 MVP 用 Llama 3.2 1B 跑,完全不花钱。先在免费额度内验证产品逻辑,再考虑升级。
第二,Workers AI 不是所有 AI 任务的答案。 它跑的是开源模型,不是 GPT-4o 或 Claude。如果你的产品强依赖闭源模型的能力(复杂推理、长上下文),Workers AI 做不了主力。但它可以做兜底:简单任务用 Workers AI 省钱,复杂任务再调闭源 API。
第三,CPU time 是另一个成本维度。 Workers Paid 计划每月包含 30,000,000 CPU 毫秒,超出后 $0.02 / 百万 CPU 毫秒。AI 推理的 Worker 如果还做了预处理、JSON 解析、数据库读写,这些 CPU 时间也算钱。好在单次推理的 CPU 开销通常在毫秒级,不容易超标。
一个实际可部署的架构
如果你要从零搭一个 AI 应用,最小架构是这样:
- Workers:处理 HTTP 请求,调用 Workers AI 做推理
- D1:存用户数据、对话历史(免费额度足够 MVP)
- Vectorize:如果做 RAG,存向量索引
- KV:存配置和缓存
这个架构的好处是全在 Cloudflare 生态内,延迟低、不收带宽费。Workers 之间调用不额外收费,D1 和 KV 的免费额度对 MVP 阶段够用。
部署也简单。wrangler deploy 一条命令,模型绑定在 wrangler.toml 里配好就行。不需要 Docker、不需要 Kubernetes、不需要管 GPU 驱动。
成本控制的两个实操技巧
技巧一:加缓存。 AI Gateway 支持 response caching,相同请求直接返回缓存结果,不消耗 Neurons。对于”固定 prompt + 固定输入”的场景(比如文档摘要、模板生成),缓存命中率能到 60% 以上,成本直接砍掉一半。
技巧二:模型降级。 用 AI Gateway 配 fallback 策略:首选 8B 模型,但简单请求降级到 1B。通过 prompt 长度判断复杂度,短输入走 1B、长输入走 8B。这种动态路由在日常流量里能省 30%-40% 的 Neuron 消耗。
小结
Workers AI 对独立开发者最大的价值不是”便宜”,而是”成本可预测”。VPS 你不知道什么时候会爆,自建 GPU 你不知道什么时候会坏。serverless GPU 按用量算,免费额度能兜住 MVP,付费也是线性增长。
做技术选型时,先把你的请求量和 token 量估出来,套进上面的公式算一下。如果月成本在 $10 以内,Workers AI 大概率是对的答案。
数据来源:
- Cloudflare Workers AI 定价文档(developers.cloudflare.com/workers-ai/platform/pricing/,2026-10-01 更新):Neuron 单价 $0.011/1,000,免费额度 10,000 Neurons/天,各模型 Neuron 消耗表
- Cloudflare Workers 定价文档(developers.cloudflare.com/workers/platform/pricing/,2026-08-28 更新):Paid 计划 $5/月,包含 10M 请求/月、30M CPU 毫秒/月
- Cloudflare Workers AI 产品文档(developers.cloudflare.com/workers-ai/):50+ 开源模型、serverless GPU、AI Gateway 缓存功能
