LLM 时代商业模式展望
核心判断
LLM 时代的商业模式不会停留在“订阅还是 API”这个二分法。更稳定的结构会是:订阅买入口和确定性,用量买真实算力,优先级买延迟和容量,成果计费买业务价值,交易和生态分成买入口位置。
为什么 LLM 改变商业模式
传统软件的边际成本接近于零,最自然的收费单位是 seat、版本、功能模块和组织规模。LLM 产品不同:每一次调用都真实消耗推理算力,成本会随着上下文长度、输出长度、模型强度、模态、工具调用、实时性和并发规模变化。
这意味着 AI 产品必须同时解决两个问题:
- 用户需要一个简单、可预期的购买感受。
- 厂商需要一个能覆盖高强度推理成本的单位经济模型。
因此,LLM 商业化会天然变成混合模型:前台用订阅、会员、额度、任务包、成果包让用户理解;后台用 token、cached input、GPU time、workflow execution、resolution、transaction、capacity unit 来对齐真实成本。
商业模式谱系
下表的代表案例是 2026-06-09 的公开资料快照,长期价值在模式分类,不在具体价格或套餐名。
| 模式 | 典型计费单位 | 代表案例 | 适合场景 | 核心风险 |
|---|---|---|---|---|
| API 用量计费 | input token、cached input、output token、tool call、音频分钟、视频秒 | OpenAI、Anthropic、Gemini | 开发者 API、RAG、后台生成、批处理 | 用户难以预估账单 |
| 缓存计费 | cache write、cache read、cache storage | Anthropic prompt caching、Gemini context caching、OpenAI cached input | 长上下文、Agent 循环、代码库、文档库 | prompt 结构变化会破坏缓存收益 |
| 延迟与容量计费 | Batch、Flex、Priority、Scale Tier、PTU、reserved capacity | OpenAI Scale Tier、Azure Provisioned Throughput | 生产级 Agent、客服、搜索、实时交互 | 容量预购利用率不足 |
| 消费订阅 | 月费、消息量、模型等级、上下文窗口、记忆、广告或无广告权益 | ChatGPT Go/Plus/Pro、Claude Pro/Max、Character.AI c.ai+ | 高频个人使用、陪伴、生产力 | 重度用户亏损,轻度用户补贴 |
| Credits / Points 钱包 | AI credits、compute points、生成 credits、美元余额 | GitHub Copilot、Poe、OpenRouter、Runway、Inworld | 多模型、多模态、高成本能力 | 点数黑箱化,用户不懂单价 |
| Agent 行动 / 成果计费 | resolution、automated resolution、conversation、action、workflow execution | Intercom Fin、Zendesk、Salesforce Agentforce、Microsoft Copilot PAYG、Zapier Agents | 客服、销售、办公自动化、IT 流程 | 成果定义和归因争议 |
| 交易与广告 | CPM、CPC、转化抽成、Instant Checkout、商家接入 | ChatGPT Ads、OpenAI + Instacart、AI shopping | 搜索、导购、本地服务、电商 | 信任、排序公平、广告和答案边界 |
| BYOK / 路由 | 自带 API key、路由费、平台抽成、fallback 成功运行 | OpenRouter、Convai Connect、Inworld BYOK | 高级用户、企业合规、多供应商冗余 | 支持责任、密钥安全、质量不稳定 |
| 创作者生态 | 市场抽成、订阅分成、收益池、资产销售 | Roblox、Fortnite Creator Economy、Fab、ElevenLabs Voice Library | UGC、虚拟角色、AI 工具包 | 刷量、IP、审核、收益分配争议 |
关键趋势
1. “无限使用”会越来越少
早期 AI 产品喜欢用固定订阅换取增长,但重度用户会把推理成本放大到不可持续。GitHub Copilot 从 premium requests 走向 AI Credits,Runway 调整 Unlimited 到 Max,Poe 用 points 区分模型成本,本质都在做同一件事:保留订阅入口,但把高成本行为重新放回额度系统。
未来的消费级 AI 很可能保留“看起来很简单”的套餐,但套餐背后通常需要额度、限速、队列、模型降级、缓存和公平使用策略。
2. Credits 会成为用户可理解的“算力货币”
Token 是工程单位,不是用户单位。用户很难理解 input token、output token、cache read、tool call 的差异。Credits / Points 的价值在于把复杂成本折算成一个内部货币。
这对多模态产品尤其重要。Runway 可以按视频秒扣 credits,ElevenLabs 可以按字符或分钟计费,Poe 可以让不同模型消耗不同 points,GitHub Copilot 可以把一次小问题和一次长 Agent 任务放进同一个 AI Credits 框架。
Credits 的问题是透明度。用户不一定知道为什么某次任务扣得多,失败生成是否应该扣费,重试是否消耗额度。额度系统如果解释不清,会很快变成账单焦虑。
3. 缓存会从工程优化变成商业能力
长上下文和 Agent 循环是 LLM 产品的核心体验,也是成本黑洞。prompt caching、cached input、context caching 的意义不只是省钱,而是让“长期记忆、项目上下文、世界状态、角色设定、代码库理解”这些能力有了可持续的成本结构。
谁能把稳定上下文设计成高命中缓存,谁就能在同等价格下提供更长记忆、更强连续性和更低延迟。对产品设计来说,缓存不是后端细节,而是未来 AI 产品的商业护城河之一。
4. 低延迟和稳定容量会成为高级权益
实时语音、Agent 操作、客服、代码助手、游戏 runtime 都不能只看 token 单价。它们还需要低延迟、稳定吞吐、峰值容量和失败兜底。
因此,Batch/Flex 适合离线任务,Priority/Scale/Reserved Capacity 适合生产任务。用户买的不只是“更聪明的模型”,还包括“现在就回答”“不要排队”“高峰期仍然可用”“Agent 任务不要半路断掉”。
5. Outcome pricing 会扩展,但不会适合所有产品
Intercom Fin 按 outcome 收费,Zendesk 用 automated resolution,Salesforce 和 Microsoft 把 Agent 行动拆成 credits 或 conversation。这背后的判断是:企业客户不想为 token 买单,只想为结果买单。
但 outcome pricing 的前提很苛刻:结果必须可定义、可验证、可防作弊、可归因。客服里的“解决一个问题”相对清楚,创作、游戏、陪伴、开放式探索里的“结果”就很难定义。
6. AI 入口会走向交易和广告
当 LLM 不再只是回答问题,而是帮用户比较、选择、下单、预约、执行任务,它就会成为新的商业入口。ChatGPT Ads、AI shopping、Instant Checkout、Agentic Commerce Protocol 指向同一个方向:AI 不只卖算力,也卖分发、信任和转化。
这条路的风险同样明显。LLM 的价值来自用户相信它是在帮自己判断。如果广告、商家排序或赞助内容污染答案,入口型商业化会反噬产品信任。
产品设计启发
先区分三种价值
LLM 产品至少有三种价值,应该对应不同商业化方式:
- 基础可用性:回答、生成、总结、常规对话,适合订阅或免费层。
- 高成本能力:长上下文、强推理、语音、视频、实时 Agent、多轮工具调用,适合 credits、额度、队列和高级订阅。
- 可验证业务结果:客服解决、销售转化、流程完成、交易达成,适合 outcome、transaction 或 revenue share。
混淆这三种价值会带来两个坏结果:要么定价太低导致成本失控,要么把用户本来以为属于核心体验的能力拆成小额收费,破坏信任。
让用户买“体验单位”,不要买“工程单位”
用户可以理解:
- 一次深度研究
- 一个视频生成任务
- 一次自动化流程
- 一次客户问题解决
- 一个月更长记忆
- 一个创作者工具包
- 一个高优先级队列
用户不容易理解:
- 多少 input token
- 多少 output token
- cache write 是否命中
- 几次 tool call
- 模型 fallback 是否收费
好的 LLM 商业化应该把工程单位留在后台,把用户单位设计成可感知的体验单位。
免费层必须用 cheap path 支撑
免费层可以扩大入口,但不应该依赖最贵模型无限开放。更合理的结构是:
- 常规任务走小模型、本地模型、缓存、模板或低优先级队列。
- 高成本任务用次数、额度、排队或降级保护。
- 让用户明确知道升级后获得的是更长上下文、更稳定容量、更快响应、更高质量,而不是“免费层被故意做差”。
成本透明要比单价便宜更重要
AI 产品的用户不只怕贵,也怕不可预测。Copilot、Runway、Poe、Gemini API 等产品的用户讨论里,反复出现的问题不是“每单位多少钱”,而是“我不知道为什么用了这么多”“为什么失败也扣”“为什么同样任务这次更贵”。
因此,AI 产品需要成本仪表盘:按功能、模型、任务、项目、用户、失败重试、缓存命中拆分成本,让用户和开发者都能调优行为。
对 AI 原生游戏的启发
AI 原生游戏的商业化会比普通 AI 工具更难,因为玩家并不是来管理账单的。玩家来到游戏里,是为了沉浸、扮演、冒险和情绪回报。
如果游戏把 runtime LLM 的真实成本直接裸露给玩家,比如“和 NPC 多聊一句就扣真钱额度”“AI 伙伴每次推理都消耗付费点数”,玩家会从角色扮演状态掉回账单管理状态。
更适合游戏的做法是:
- 核心体验由买断、订阅、季票或内容包覆盖。
- 高成本 AI 能力放进创作者工具、实验室模式、异步生成、回放生成、UGC 制作等外围层。
- 游戏内资源可以模拟 AI 成本,但不要和真钱一一绑定。
- 付费不应购买更聪明的伙伴、更强解法或更容易胜利。
- 创作者生态可以成为长期商业化方向,但必须先解决审核、IP、声音、人格和收益分配。
这也是 TokenPunk_产品形态和商业化方案 的核心前提:LLM runtime 是卖点,但不能把玩家的 AI 共犯变成付费外挂,也不能把作品对 Token 压迫的批判变成现实账单压力。
风险清单
- 账单冲击:用户低估长上下文、语音、视频、Agent loop 的成本。
- 无限承诺不可持续:重度用户会消耗远超订阅收入的推理资源。
- 点数黑箱:credits 简化了购买,但也隐藏了真实单价和失败成本。
- 质量和成本错配:高价模型不一定总能带来可感知价值。
- 延迟被低估:实时产品需要买容量,不只是买 token。
- 广告破坏信任:AI 的回答独立性比传统信息流广告更敏感。
- BYOK 责任模糊:平台、模型供应商和用户之间的质量、安全、限流责任难分。
- 训练数据与隐私:用户提示词、输出、项目上下文和行为轨迹都可能成为敏感资产。
- 创作者生态治理:AI 角色、声音、任务、资产市场会带来 IP、人格、未成年人和审核问题。
可复用判断
- AI 产品不应只问“怎么收费”,而要先问“哪一部分成本随使用线性增长,哪一部分价值可被用户感知”。
- 用户可以买额度,但不应该被迫理解 token。
- 缓存、路由、降级、批处理和队列是商业模式的一部分,不只是技术优化。
- 如果结果不可定义,不要急着做 outcome pricing。
- 实时 LLM 产品必须先证明单位经济模型,再承诺大规模在线体验。
- 对消费产品来说,广告和交易是第二曲线,但信任是第一资产。
- 对游戏来说,现实付费最好购买内容、表达、创作和便利,不要购买系统优势。
延伸资料
这里不保留大量价格页。具体价格和套餐会持续变化,长期有价值的是它们背后的计费单位、容量逻辑和入口商业化方向。
- Tiered Super-Moore’s Law: Price Evolution in LLM Inference Services:观察 LLM 推理服务价格演化的研究线索。
- Testing ads in ChatGPT:AI 入口从订阅扩展到广告的代表性信号。
- Instacart and OpenAI partnership:对话入口连接真实交易的代表性案例。
- Shopping with ChatGPT Search:AI 搜索进入导购和购买决策的产品线索。
- Convai Connect:AI NPC / runtime AI 的开发者成本与用户侧额度分担思路。