做过 AI 产品的人都知道,模型选型只是第一步。真正让人头疼的是部署——GPU 实例贵、运维复杂、冷启动慢、成本不可控。
痛点:独立开发者做 AI 应用,卡在部署环节
去年我折腾一个 AI 翻译工具,试了几条路:租 GPU 服务器太贵(最便宜 A10G 一个月也要 2000+),用 Vercel 又限制多,AWS SageMaker 配置起来得一周。直到认真研究 Cloudflare Workers AI,才发现这条路其实走通了。
Cloudflare Workers AI 到底是什么
简单说,Workers AI 是 Cloudflare 在边缘节点上托管开源模型的服务,你通过 Workers 或 REST API 调用,按量付费,不用管 GPU 在哪。
关键更新:2026 年 8 月,Cloudflare 正式把 Workers AI 和 AI Gateway 统一成一个控制面(来源:Cloudflare Blog, 2026-08-07)。这意味着你不再需要在两个产品之间做选择——同一个 binding、同一套 REST API,自带可观测性和日志。
Workers AI 目前支持的模型包括 Llama 3、GLM-5.2、Kimi K2.6、Mistral 等主流开源模型。
推荐独立开发者的部署架构
用户请求 → Cloudflare Workers → Workers AI (边缘推理)
↘ AI Gateway (日志/缓存/限流)
↘ 外部 LLM API (回退)
这套架构的优势:零运维、低延迟(全球 330+ 城市边缘节点)、成本可控(按 tokens 计费)、容错(AI Gateway 统一路由)。
一个最小可行的示例
export default {
async fetch(request, env) {
const response = await env.AI.run(
'@cf/meta/llama-3.1-8b-instruct',
{
messages: [
{ role: 'user', content: '用一句话解释什么是 Serverless' }
]
},
{
gateway: { id: 'default' }
}
);
return new Response(JSON.stringify(response), {
headers: { 'Content-Type': 'application/json' }
});
},
};
n就这么几行代码,一个生产可用的 AI API 就部署好了。不需要 GPU、不需要 Docker、不需要配置反向代理。
n n成本到底多少
nWorkers AI 免费额度每天 10,000 次推理,超过后按量计费。Llama 3.1 8B 大约 $0.30/百万 tokens。Workers 免费计划每天 100,000 次请求。
n做个对比:自建 GPU(A10G)月费约 $600+,AWS Bedrock 需要配置 VPC/IAM,Workers AI 零配置即调即用。一个典型的 AI 写作助手,每天 1000 次请求,月费大概在 $5-15。
n nAI Gateway 统一控制面的实际价值
n每次推理请求自动记录请求体和响应体、每个模型的 token 用量统计、成本归属、自定义缓存策略、限流和权限控制。没有可观测性的 AI 应用,出问题了只能抓瞎。
n n什么场景适合 Workers AI
n适合:需要低延迟实时推理(聊天、翻译、文本生成)、原型验证和 MVP、中小规模生产应用、多模型 A/B 测试。
n不太适合:需要训练或微调模型、超大规模推理(百万级)、需要特定 GPU 配置。
n n实战建议
n- 先用 Workers AI 跑通原型——几个小时内就能上线一个可用的 API
- 接入 AI Gateway——加上日志和缓存,把数据抓起来 n
- 观察成本——利用 Gateway 的成本归属功能,看每个功能的 token 消耗 n
- 逐步替换——如果某个场景需要更便宜的模型或自建,逐步迁移 n
引用
n- Cloudflare Blog (2026-08-07). “Unifying Workers AI and AI Gateway into a single AI control plane”. https://blog.cloudflare.com/workers-ai-gateway-unification/
- Cloudflare Blog (2026-08-03). “Smaller, faster, safer: running Kimi and GLM at scale”. FP8 KV Cache 量化可将 64 并发推理吞吐提升 41%,成本降低约 30%。
