价格事实
价格核验于 2026-08-29.
| Model | Input / 1M | Output / 1M | Cached input / 1M |
|---|---|---|---|
| GPT-5.6 Luna | $0.20 | $1.20 | $0.02 |
| GPT-5.6 Terra | $2.00 | $12.00 | $0.20 |
| GPT-5.6 Sol | $4.00 | $20.00 | $0.40 |
| Claude Sonnet 5 | $2.00 | $10.00 | — |
| Claude Opus 5 | $5.00 | $25.00 | — |
| DeepSeek V4 Flash off-peak | $0.22 | $0.66 | $0.007 |
哪些是测量、估算与未知
| 分类 | 结论 |
|---|---|
| 测量 | ML.ENERGY leaderboard reports about 0.39 J per output token for a 70B FP8 H100 configuration; this is an aggregate benchmark measure. |
| 估算 | Joule figures are bottom-up inference estimates, not a production electricity meter for a named provider. |
| 未知 | Closed-model production J/token and unit profit are not public facts. |
# 一度电,能换多少智能?
从 Electricity → Token → Product
HoopGram Learn · Research Note · Last checked: 2026-08-29
我们把训练成本先放到一边,只看一件事:人类把电送进数据中心 → GPU / TPU 计算 → 模型读入 Input Token、生成 Output Token → 代码与答案 → 产品与行动。 这其实是一台“电 → 智力 → 现实”的机器。
> 30 秒版本:今天,1 kWh 大致可以支撑几十万到上千万级的模型输出 Token,具体取决于模型、上下文、batching 与 reasoning 强度;Coding Agent 的 Input Token 往往远大于 Output Token;用户付出的 $1 里,原始电费通常只是很小一部分,真正昂贵的是 GPU/TPU、HBM、网络、机房与可用算力;如果把 Token 映射到软件,一个个人网站大约是百万级 Input,一个完整 SaaS 往往进入亿级,一个 X/Airbnb/YouTube 风格 MVP 可以进入十亿级。[[1]](#ref-1)[[2]](#ref-2)[[11]](#ref-11)
1. 先建立宇宙尺度:一度电能换多少 Token?
1 kWh = 3,600,000 J。 在高度优化的 H100 / FP8 / batching 条件下,公开 benchmark 显示 70B 级模型可以逼近约 0.39 J / output token 的数量级;换算就是约 900 万 output tokens / kWh。这更接近“高效率下限”,不是所有模型的日常状态。[[1]](#ref-1)
更大的模型、长上下文与 reasoning 会明显增加能耗。Joule 2026 的生产级研究估计,普通 frontier-scale 请求中位约 0.31 Wh / query,长 reasoning 请求中位约 3.91 Wh / query;研究整理的 DeepSeek-V3 长请求约 9.3 Wh / 8,968 output tokens,DeepSeek-R1 约 20.9 Wh / 11,287 output tokens,分别约等于 96 万与 54 万 output tokens / kWh。[[2]](#ref-2)
| 工作负载 | 公开数据给出的数量级 | 1 kWh 大约对应 |
|---|---|---|
| 高度优化的 70B 级模型 | ~0.39 J / output token | ~900 万 output tokens |
| 大型模型 / 常规 frontier workload | 约 1–3 J / token 的量级 | ~120 万–360 万 |
| DeepSeek-V3 长请求 | ~3.7 J / final output token | ~96 万 |
| DeepSeek-R1 长 reasoning | ~6.7 J / final output token | ~54 万 |
最适合记住的不是某个小数,而是:今天的一度电,已经能变成百万级 AI Token;高效模型可以冲到千万级,重 reasoning 则可能掉到几十万级。
这里还有一个重要边界:OpenAI 和 Anthropic 没有公开现役闭源模型在真实生产集群里的每 Token 电表数据;DeepSeek 公布了更多模型结构,但也没有公开 V4 API 集群的精确 J/token。因此,我们可以建立可信的行业数量级,不能诚实地写出“GPT-5.6 Sol = 2.137 J/token”这种看似精确的公司级数字。
2. Input Token 和 Output Token,不是一回事
Input Token = AI 读了多少;Output Token = AI 写了多少。 对普通聊天,这个区别只是计费问题;对 Coding Agent,它几乎决定了整个经济模型。
推理通常分成两段:Prefill 先把输入上下文读进去,可以高度并行;Decode 再一个 Token 一个 Token 地生成输出,天然更串行。Joule 的研究指出,在许多真实 workload 中,长输出与 reasoning 会显著推高能耗。[[2]](#ref-2)
所以你看到的一个短答案,背后可能已经读过几十万 Token;一个 Coding Agent 改 20 行代码,也可能先把整个 repository、terminal 输出、测试结果与自己刚写过的代码又读了一遍。
3. OpenAI、Anthropic、DeepSeek:Token 今天多少钱?
以下是 2026-08-29 核验的官方 API 标价;DeepSeek 使用非高峰价。[[3]](#ref-3)[[4]](#ref-4)[[5]](#ref-5)[[6]](#ref-6)
| 公司 / 模型 | Input / 1M | Output / 1M | $1 能买到的 Output |
|---|---|---|---|
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | ~833K |
| OpenAI GPT-5.6 Terra | $2.00 | $12.00 | ~83K |
| OpenAI GPT-5.6 Sol | $4.00 | $20.00 | 50K |
| Anthropic Claude Sonnet 5 | $2.00 | $10.00 | 100K |
| Anthropic Claude Opus 5 | $5.00 | $25.00 | 40K |
| DeepSeek V4 Flash · off-peak | $0.22 | $0.66 | ~1.52M |
| DeepSeek V4 Pro · off-peak | $0.66 | $1.98 | ~505K |
Caching 会再次改变账单:GPT-5.6 Sol 的 cached input 是 $0.40 / 1M;Anthropic 的官方 prompt-caching 文档给出 cache read 为正常 input 的 0.1×;这是一个算术上的 90% 差额,不应写成公司作出的“最高节省”承诺;DeepSeek V4 Flash 的非高峰 cache-hit input 低到 $0.007 / 1M。[[3]](#ref-3)[[4]](#ref-4)[[6]](#ref-6)
DeepSeek V4 也很好地解释了为什么“模型总参数”不等于“每个 Token 都把整个模型点亮”。V4 Flash 是 284B total / 13B active params,V4 Pro 是 1.6T total / 49B active params:图书馆可以很大,但回答一个问题时,不需要把每一层书架的灯都打开。[[7]](#ref-7)
4. 用户付 $1,真正有多少变成了电?
先做一个思想实验,不冒充三家公司的真实账单。美国 2025 年工业平均电价约 $0.0862 / kWh。[[8]](#ref-8) 如果把大型模型的现实能耗粗略放在 0.5M–5M output tokens / kWh 这个宽区间:
- GPT-5.6 Sol:$1 = 50K output tokens,对应约 0.01–0.10 kWh,原始电费约 $0.00086–$0.00862,也就是约 0.09–0.86 美分。
- Claude Sonnet 5:$1 = 100K output tokens,对应约 0.02–0.20 kWh,原始电费约 $0.0017–$0.017,也就是约 0.17–1.72 美分。
这解释了一个看似矛盾的事实:AI 整体很耗电,但单个 Token 的电本身可以很便宜。 数据中心真正昂贵的部分,是把电稳定地变成 Token 的机器:GPU / TPU、HBM、CPU、网络、存储、机房、冷却、冗余容量、云租金与折旧。
所以 $1 不是:$1 − 电费 = 利润。 更接近:$1 → accelerator / HBM / network / data center / electricity / serving / support → gross profit → R&D / training / sales / admin → 才可能变成净利润。
公司级数据也验证了这点。Reuters 报道 OpenAI 2025 年调整后 gross margin 约 33%,而 The Information 报道其 inference cost 增至约 $8.4B;Anthropic 2025 年的外部汇总估计约 40% gross margin、$2.7B inference compute。这些都是公司整体数据,不是“某个模型一个 Token 的利润”。DeepSeek 没有公开足够可靠的最新公司级毛利数据,所以答案就是:unknown。[[9]](#ref-9)[[10]](#ref-10)
> 电是燃料,GPU 是发动机。 AI 公司卖的不是一度电,而是“昂贵芯片上的时间 × 模型能力 × 低延迟可用性”。
5. Token 最后能变成什么?
这时我们终于可以从“电 → Token”继续走到“Token → 产品”。先看真实世界的 Coding Agent。
华盛顿大学 SyFI TraceLab 收集了 8,058 个真实 Claude Code + Codex sessions:总计 114.2B input tokens、其中 109.2B cached-read tokens,以及 391.8M output tokens。平均每个 session 约 14.2M input / 49K output;总 Input : Output 接近 290 : 1,但其中约 95.6% 的 input 是缓存读取的上下文。[[11]](#ref-11)
这不是异常,而是 Agent 工作方式本身:看整个项目 → 改一点 → 跑工具 → 看结果 → 再看整个项目 → 再改一点。 另一项 2026 年针对 agentic coding 的系统研究发现,这类任务可以比普通 code reasoning / code chat 消耗约 1000× 更多 Token,而且主要由 Input Token 推动;同一个任务的不同运行,Token 使用甚至可相差 30×。[[12]](#ref-12)
因此不存在“X = 73,291,442 Tokens”这种宇宙常数。下面是一把工程数量级尺:用现代 Claude Code / Codex 类 Coding Agent,从相对干净的项目开始,包含设计、实现、测试、debug 与若干轮修改。项目 Token 区间是工程估算,USD 则严格按 Claude Sonnet 5:$2/M input + $10/M output,且把 Input 全部按未缓存价格计算。这使不同项目可以放在同一把尺上;真实有 cache 的账单常常更低。[[4]](#ref-4)[[11]](#ref-11)[[12]](#ref-12)
| 要创造的东西 | Input Token | Output Token | API Cost · Sonnet 5 |
|---|---|---|---|
| 简单 Landing Page | 0.5M–3M | 10K–50K | $1–$7 |
| 个人网站 | 1M–10M | 30K–150K | $2–$22 |
| Apple / OpenAI 风格公司网站 | 10M–50M | 100K–500K | $21–$105 |
| 小型 Full-stack SaaS | 50M–300M | 0.5M–3M | $105–$630 |
| Airbnb / X / YouTube 风格 MVP | 300M–2B | 3M–20M | $630–$4,200 |
| 成熟 Production App | 2B–20B | 20M–200M | $4,200–$42,000 |
| 真正的 X / Airbnb / YouTube 级系统 | 10B–100B+ | 100M–1B+ | $21K–$210K+ |
这些不是开发报价,也不是这些公司历史上真正花过的钱。 它们是在问一个更纯粹的问题:如果今天把现代 Coding Agent 的“读、写、测试、返工”都算进去,软件工程大约跨越哪些 Token 数量级?不确定性可以轻易达到数倍,极端项目甚至超过 10×;这正是为什么表格给区间,不给漂亮的小数点。
6. 从个人网站,到真正的 X
个人网站:百万 Input 的世界。 About、Projects、Blog、Contact、响应式、动画与部署,最终代码可能只有几十 K Token,但 Agent 为了理解和修改它,可能已经读过几百万 Token。作品很小,过程很长。
Apple.com / OpenAI.com:千万 Input 的世界。 Design System、多页面、复杂动画、CMS、Blog、Docs、SEO、国际化、Accessibility、Analytics、测试与部署,把“网页”变成长期维护的网站。但这里说的是 Apple.com 这个网站,不是 Apple。网页只是门面,公司在门后面。
普通 SaaS:亿级 Input 的世界。 一旦加入账户、数据库、API、支付、搜索、通知、权限、后台、测试、监控与生产部署,网页就变成了系统。
X / Airbnb / YouTube 风格 MVP:十亿级 Input 的世界。 你可以做出注册、Feed、Follow、Like、Search、Upload、Notification、Payments、Recommendation 的第一版;它已经“像 X”,甚至可以有真实用户,但还不是 X。
真正的 X:百亿级 Input 的世界。 全球 Feed Ranking、Trust & Safety、反垃圾、广告、视频转码、CDN、搜索集群、推荐系统、数据管道、数据库分片、Observability、多机房容灾,以及十几年留下的兼容性问题,才构成真实的互联网级平台。X 的 UI,不是 X;画出 Boeing 787 的驾驶舱,也没有顺便得到一架 Boeing 787。
7. $1 能买多少 Coding?
为了建立另一个很容易记住的尺度,假设一次工作消耗 1M Input + 100K Output,全部 Input 按 cache miss / uncached 计算:
| 模型 | 这份工作大约多少钱 |
|---|---|
| DeepSeek V4 Flash · off-peak | $0.29 |
| DeepSeek V4 Pro · off-peak | $0.86 |
| Claude Sonnet 5 | $3.00 |
| GPT-5.6 Sol | $6.00 |
同样数量的 Token,不是同样的钱,也不一定是同样的智能。 便宜模型可能需要更多轮,昂贵模型也可能一次解决。因此未来真正有意义的价格单位不是 $/Token,而更接近 $/Solved Problem。
8. 最后,把整条链连起来
> Electricity → Computation → Input Tokens → Reasoning → Output Tokens → Code / Answer → Product → Action
最开始我们问:1 kWh 能产生多少 Token? 然后问题变成:1M Token 能创造什么?$1 能创造什么?1 kWh 最终能创造什么?
Token 只是今天方便计费的中间单位。真正值得长期观察的,也许是:
> Useful Intelligence / kWh — 每一度电,产生多少有用智能? > Solved Problems / kWh — 每一度电,解决多少真实问题? > $/Solved Problem — 解决一个真实问题,还需要多少钱?
如果有一天 1 kWh 能让一个 AI 完成过去一个人一个月才能完成的真实工作,那么改变的就不只是“Token 又便宜了”,而是:电开始可以大规模兑换认知与劳动。
这可能才是 AI 革命真正深的一层。
方法与边界
本文刻意把结论分成三类:测量(公开 benchmark / 官方价格 / 真实 agent traces)、估算(产品复杂度对应的 Token 数量级、用统一模型价格换算 USD)、未知(闭源模型真实 J/token、公司单模型单位成本与单位利润)。项目 Token 估算不是 benchmark 结论,而是以 TraceLab 和 agentic-coding 研究作为现实锚点的工程尺度;不要把它用于财务预测时当作精确报价。价格与模型会变化,因此本文标记 Last checked: 2026-08-29。
Sources
<a id="ref-1"></a>[1] ML.ENERGY Benchmark / Leaderboard. NeurIPS 2025 Datasets and Benchmarks Track. Production-oriented inference energy measurement and optimization. https://proceedings.neurips.cc/paper_files/paper/2025/file/9dc510e3d7b0b3b2a58ffed7a3ad6b0f-Paper-Datasets_and_Benchmarks_Track.pdf
<a id="ref-2"></a>[2] Energy use of AI inference, efficiency pathways, and test-time scaling. Joule, published online 22 Apr 2026. Bottom-up inference energy estimates; not a production electricity meter for any named provider. https://www.sciencedirect.com/science/article/pii/S2542435126001145
<a id="ref-3"></a>[3] OpenAI GPT-5.6 models / pricing. OpenAI Developers. GPT-5.6 Sol, Terra and Luna official API prices; Sol cached input price. https://developers.openai.com/api/docs/models/compare
<a id="ref-4"></a>[4] Claude Sonnet 5. Anthropic. Official price page; cache mechanics are sourced separately from Anthropic prompt-caching docs, where cache reads are billed at 0.1× input. https://www.anthropic.com/research/claude-sonnet-5
<a id="ref-5"></a>[5] Claude Opus 5. Anthropic. Official $5/M input and $25/M output pricing. https://www.anthropic.com/news/claude-opus-5
<a id="ref-6"></a>[6] DeepSeek Models & Pricing. DeepSeek API Docs. V4 Flash / Pro peak and off-peak input, cache-hit and output pricing. https://api-docs.deepseek.com/quick_start/pricing/
<a id="ref-7"></a>[7] DeepSeek V4 Preview Release. DeepSeek API Docs. V4 Pro: 1.6T total / 49B active params; V4 Flash: 284B total / 13B active params. https://api-docs.deepseek.com/news/news260424/
<a id="ref-8"></a>[8] U.S. electricity prices. U.S. Energy Information Administration. 2025 U.S. industrial average electricity price: 8.62 cents/kWh. https://www.eia.gov/energyexplained/electricity/prices-and-factors-affecting-prices.php
<a id="ref-9"></a>[9] OpenAI compute spending / margin. Reuters, 20 Feb 2026. Reports OpenAI 2025 adjusted gross margin fell to 33%; The Information reported inference costs rose fourfold to $8.4B. https://www.reuters.com/technology/openai-sees-compute-spend-around-600-billion-by-2030-cnbc-reports-2026-02-20/
<a id="ref-10"></a>[10] AI company spending breakdown. Epoch AI, 2026. Summarizes Anthropic 2025 revenue $4.5B, inference compute $2.7B and gross margin 40%, based on reported company projections. https://epoch.ai/data-insights/company-spending-breakdown
<a id="ref-11"></a>[11] SyFI TraceLab. University of Washington. Public Claude Code + Codex traces: 8,058 sessions, 114.2B input tokens, 109.2B cached-read tokens, 391.8M output tokens. https://tracelab.cs.washington.edu/
<a id="ref-12"></a>[12] How Do AI Agents Spend Your Money?. Bai et al., arXiv:2604.22750, 2026. Agentic coding can consume ~1000x more tokens than code reasoning/chat; same-task runs vary by up to 30x, driven mainly by input tokens. https://arxiv.org/abs/2604.22750