HoopGram
菜单

HoopGram Learn · Agent foundations

一度电,能换多少智能?

从 Electricity 到 Token、Product 与 Action:一篇带来源、边界和复审日期的 Agent 世界基础课。

下载规范 Markdown,导入你的 Study 书库

价格事实

价格核验于 2026-08-29.

ModelInput / 1MOutput / 1MCached input / 1M
GPT-5.6 Luna$0.20$1.20$0.02
GPT-5.6 Terra$2.00$12.00$0.20
GPT-5.6 Sol$4.00$20.00$0.40
Claude Sonnet 5$2.00$10.00
Claude Opus 5$5.00$25.00
DeepSeek V4 Flash off-peak$0.22$0.66$0.007

哪些是测量、估算与未知

分类结论
测量ML.ENERGY leaderboard reports about 0.39 J per output token for a 70B FP8 H100 configuration; this is an aggregate benchmark measure.
估算Joule figures are bottom-up inference estimates, not a production electricity meter for a named provider.
未知Closed-model production J/token and unit profit are not public facts.

# 一度电,能换多少智能?

从 Electricity → Token → Product

HoopGram Learn · Research Note · Last checked: 2026-08-29

我们把训练成本先放到一边,只看一件事:人类把电送进数据中心 → GPU / TPU 计算 → 模型读入 Input Token、生成 Output Token → 代码与答案 → 产品与行动。 这其实是一台“电 → 智力 → 现实”的机器。

> 30 秒版本:今天,1 kWh 大致可以支撑几十万到上千万级的模型输出 Token,具体取决于模型、上下文、batching 与 reasoning 强度;Coding Agent 的 Input Token 往往远大于 Output Token;用户付出的 $1 里,原始电费通常只是很小一部分,真正昂贵的是 GPU/TPU、HBM、网络、机房与可用算力;如果把 Token 映射到软件,一个个人网站大约是百万级 Input,一个完整 SaaS 往往进入亿级,一个 X/Airbnb/YouTube 风格 MVP 可以进入十亿级。[[1]](#ref-1)[[2]](#ref-2)[[11]](#ref-11)

1. 先建立宇宙尺度:一度电能换多少 Token?

1 kWh = 3,600,000 J。 在高度优化的 H100 / FP8 / batching 条件下,公开 benchmark 显示 70B 级模型可以逼近约 0.39 J / output token 的数量级;换算就是约 900 万 output tokens / kWh。这更接近“高效率下限”,不是所有模型的日常状态。[[1]](#ref-1)

更大的模型、长上下文与 reasoning 会明显增加能耗。Joule 2026 的生产级研究估计,普通 frontier-scale 请求中位约 0.31 Wh / query,长 reasoning 请求中位约 3.91 Wh / query;研究整理的 DeepSeek-V3 长请求约 9.3 Wh / 8,968 output tokens,DeepSeek-R1 约 20.9 Wh / 11,287 output tokens,分别约等于 96 万54 万 output tokens / kWh。[[2]](#ref-2)

工作负载公开数据给出的数量级1 kWh 大约对应
高度优化的 70B 级模型~0.39 J / output token~900 万 output tokens
大型模型 / 常规 frontier workload约 1–3 J / token 的量级~120 万–360 万
DeepSeek-V3 长请求~3.7 J / final output token~96 万
DeepSeek-R1 长 reasoning~6.7 J / final output token~54 万

最适合记住的不是某个小数,而是:今天的一度电,已经能变成百万级 AI Token;高效模型可以冲到千万级,重 reasoning 则可能掉到几十万级。

这里还有一个重要边界:OpenAI 和 Anthropic 没有公开现役闭源模型在真实生产集群里的每 Token 电表数据;DeepSeek 公布了更多模型结构,但也没有公开 V4 API 集群的精确 J/token。因此,我们可以建立可信的行业数量级,不能诚实地写出“GPT-5.6 Sol = 2.137 J/token”这种看似精确的公司级数字。

2. Input Token 和 Output Token,不是一回事

Input Token = AI 读了多少;Output Token = AI 写了多少。 对普通聊天,这个区别只是计费问题;对 Coding Agent,它几乎决定了整个经济模型。

推理通常分成两段:Prefill 先把输入上下文读进去,可以高度并行;Decode 再一个 Token 一个 Token 地生成输出,天然更串行。Joule 的研究指出,在许多真实 workload 中,长输出与 reasoning 会显著推高能耗。[[2]](#ref-2)

所以你看到的一个短答案,背后可能已经读过几十万 Token;一个 Coding Agent 改 20 行代码,也可能先把整个 repository、terminal 输出、测试结果与自己刚写过的代码又读了一遍。

3. OpenAI、Anthropic、DeepSeek:Token 今天多少钱?

以下是 2026-08-29 核验的官方 API 标价;DeepSeek 使用非高峰价。[[3]](#ref-3)[[4]](#ref-4)[[5]](#ref-5)[[6]](#ref-6)

公司 / 模型Input / 1MOutput / 1M$1 能买到的 Output
OpenAI GPT-5.6 Luna$0.20$1.20~833K
OpenAI GPT-5.6 Terra$2.00$12.00~83K
OpenAI GPT-5.6 Sol$4.00$20.0050K
Anthropic Claude Sonnet 5$2.00$10.00100K
Anthropic Claude Opus 5$5.00$25.0040K
DeepSeek V4 Flash · off-peak$0.22$0.66~1.52M
DeepSeek V4 Pro · off-peak$0.66$1.98~505K

Caching 会再次改变账单:GPT-5.6 Sol 的 cached input 是 $0.40 / 1M;Anthropic 的官方 prompt-caching 文档给出 cache read 为正常 input 的 0.1×;这是一个算术上的 90% 差额,不应写成公司作出的“最高节省”承诺;DeepSeek V4 Flash 的非高峰 cache-hit input 低到 $0.007 / 1M。[[3]](#ref-3)[[4]](#ref-4)[[6]](#ref-6)

DeepSeek V4 也很好地解释了为什么“模型总参数”不等于“每个 Token 都把整个模型点亮”。V4 Flash 是 284B total / 13B active params,V4 Pro 是 1.6T total / 49B active params:图书馆可以很大,但回答一个问题时,不需要把每一层书架的灯都打开。[[7]](#ref-7)

4. 用户付 $1,真正有多少变成了电?

先做一个思想实验,不冒充三家公司的真实账单。美国 2025 年工业平均电价约 $0.0862 / kWh。[[8]](#ref-8) 如果把大型模型的现实能耗粗略放在 0.5M–5M output tokens / kWh 这个宽区间:

  • GPT-5.6 Sol:$1 = 50K output tokens,对应约 0.01–0.10 kWh,原始电费约 $0.00086–$0.00862,也就是约 0.09–0.86 美分
  • Claude Sonnet 5:$1 = 100K output tokens,对应约 0.02–0.20 kWh,原始电费约 $0.0017–$0.017,也就是约 0.17–1.72 美分

这解释了一个看似矛盾的事实:AI 整体很耗电,但单个 Token 的电本身可以很便宜。 数据中心真正昂贵的部分,是把电稳定地变成 Token 的机器:GPU / TPU、HBM、CPU、网络、存储、机房、冷却、冗余容量、云租金与折旧。

所以 $1 不是:$1 − 电费 = 利润。 更接近:$1 → accelerator / HBM / network / data center / electricity / serving / support → gross profit → R&D / training / sales / admin → 才可能变成净利润。

公司级数据也验证了这点。Reuters 报道 OpenAI 2025 年调整后 gross margin 约 33%,而 The Information 报道其 inference cost 增至约 $8.4B;Anthropic 2025 年的外部汇总估计约 40% gross margin$2.7B inference compute。这些都是公司整体数据,不是“某个模型一个 Token 的利润”。DeepSeek 没有公开足够可靠的最新公司级毛利数据,所以答案就是:unknown。[[9]](#ref-9)[[10]](#ref-10)

> 电是燃料,GPU 是发动机。 AI 公司卖的不是一度电,而是“昂贵芯片上的时间 × 模型能力 × 低延迟可用性”。

5. Token 最后能变成什么?

这时我们终于可以从“电 → Token”继续走到“Token → 产品”。先看真实世界的 Coding Agent。

华盛顿大学 SyFI TraceLab 收集了 8,058 个真实 Claude Code + Codex sessions:总计 114.2B input tokens、其中 109.2B cached-read tokens,以及 391.8M output tokens。平均每个 session 约 14.2M input / 49K output;总 Input : Output 接近 290 : 1,但其中约 95.6% 的 input 是缓存读取的上下文。[[11]](#ref-11)

这不是异常,而是 Agent 工作方式本身:看整个项目 → 改一点 → 跑工具 → 看结果 → 再看整个项目 → 再改一点。 另一项 2026 年针对 agentic coding 的系统研究发现,这类任务可以比普通 code reasoning / code chat 消耗约 1000× 更多 Token,而且主要由 Input Token 推动;同一个任务的不同运行,Token 使用甚至可相差 30×。[[12]](#ref-12)

因此不存在“X = 73,291,442 Tokens”这种宇宙常数。下面是一把工程数量级尺:用现代 Claude Code / Codex 类 Coding Agent,从相对干净的项目开始,包含设计、实现、测试、debug 与若干轮修改。项目 Token 区间是工程估算,USD 则严格按 Claude Sonnet 5:$2/M input + $10/M output,且把 Input 全部按未缓存价格计算。这使不同项目可以放在同一把尺上;真实有 cache 的账单常常更低。[[4]](#ref-4)[[11]](#ref-11)[[12]](#ref-12)

要创造的东西Input TokenOutput TokenAPI Cost · Sonnet 5
简单 Landing Page0.5M–3M10K–50K$1–$7
个人网站1M–10M30K–150K$2–$22
Apple / OpenAI 风格公司网站10M–50M100K–500K$21–$105
小型 Full-stack SaaS50M–300M0.5M–3M$105–$630
Airbnb / X / YouTube 风格 MVP300M–2B3M–20M$630–$4,200
成熟 Production App2B–20B20M–200M$4,200–$42,000
真正的 X / Airbnb / YouTube 级系统10B–100B+100M–1B+$21K–$210K+

这些不是开发报价,也不是这些公司历史上真正花过的钱。 它们是在问一个更纯粹的问题:如果今天把现代 Coding Agent 的“读、写、测试、返工”都算进去,软件工程大约跨越哪些 Token 数量级?不确定性可以轻易达到数倍,极端项目甚至超过 10×;这正是为什么表格给区间,不给漂亮的小数点。

6. 从个人网站,到真正的 X

个人网站:百万 Input 的世界。 About、Projects、Blog、Contact、响应式、动画与部署,最终代码可能只有几十 K Token,但 Agent 为了理解和修改它,可能已经读过几百万 Token。作品很小,过程很长。

Apple.com / OpenAI.com:千万 Input 的世界。 Design System、多页面、复杂动画、CMS、Blog、Docs、SEO、国际化、Accessibility、Analytics、测试与部署,把“网页”变成长期维护的网站。但这里说的是 Apple.com 这个网站,不是 Apple。网页只是门面,公司在门后面。

普通 SaaS:亿级 Input 的世界。 一旦加入账户、数据库、API、支付、搜索、通知、权限、后台、测试、监控与生产部署,网页就变成了系统。

X / Airbnb / YouTube 风格 MVP:十亿级 Input 的世界。 你可以做出注册、Feed、Follow、Like、Search、Upload、Notification、Payments、Recommendation 的第一版;它已经“像 X”,甚至可以有真实用户,但还不是 X。

真正的 X:百亿级 Input 的世界。 全球 Feed Ranking、Trust & Safety、反垃圾、广告、视频转码、CDN、搜索集群、推荐系统、数据管道、数据库分片、Observability、多机房容灾,以及十几年留下的兼容性问题,才构成真实的互联网级平台。X 的 UI,不是 X;画出 Boeing 787 的驾驶舱,也没有顺便得到一架 Boeing 787。

7. $1 能买多少 Coding?

为了建立另一个很容易记住的尺度,假设一次工作消耗 1M Input + 100K Output,全部 Input 按 cache miss / uncached 计算:

模型这份工作大约多少钱
DeepSeek V4 Flash · off-peak$0.29
DeepSeek V4 Pro · off-peak$0.86
Claude Sonnet 5$3.00
GPT-5.6 Sol$6.00

同样数量的 Token,不是同样的钱,也不一定是同样的智能。 便宜模型可能需要更多轮,昂贵模型也可能一次解决。因此未来真正有意义的价格单位不是 $/Token,而更接近 $/Solved Problem

8. 最后,把整条链连起来

> Electricity → Computation → Input Tokens → Reasoning → Output Tokens → Code / Answer → Product → Action

最开始我们问:1 kWh 能产生多少 Token? 然后问题变成:1M Token 能创造什么?$1 能创造什么?1 kWh 最终能创造什么?

Token 只是今天方便计费的中间单位。真正值得长期观察的,也许是:

> Useful Intelligence / kWh — 每一度电,产生多少有用智能? > Solved Problems / kWh — 每一度电,解决多少真实问题? > $/Solved Problem — 解决一个真实问题,还需要多少钱?

如果有一天 1 kWh 能让一个 AI 完成过去一个人一个月才能完成的真实工作,那么改变的就不只是“Token 又便宜了”,而是:电开始可以大规模兑换认知与劳动。

这可能才是 AI 革命真正深的一层。

方法与边界

本文刻意把结论分成三类:测量(公开 benchmark / 官方价格 / 真实 agent traces)、估算(产品复杂度对应的 Token 数量级、用统一模型价格换算 USD)、未知(闭源模型真实 J/token、公司单模型单位成本与单位利润)。项目 Token 估算不是 benchmark 结论,而是以 TraceLab 和 agentic-coding 研究作为现实锚点的工程尺度;不要把它用于财务预测时当作精确报价。价格与模型会变化,因此本文标记 Last checked: 2026-08-29

Sources

<a id="ref-1"></a>[1] ML.ENERGY Benchmark / Leaderboard. NeurIPS 2025 Datasets and Benchmarks Track. Production-oriented inference energy measurement and optimization. https://proceedings.neurips.cc/paper_files/paper/2025/file/9dc510e3d7b0b3b2a58ffed7a3ad6b0f-Paper-Datasets_and_Benchmarks_Track.pdf

<a id="ref-2"></a>[2] Energy use of AI inference, efficiency pathways, and test-time scaling. Joule, published online 22 Apr 2026. Bottom-up inference energy estimates; not a production electricity meter for any named provider. https://www.sciencedirect.com/science/article/pii/S2542435126001145

<a id="ref-3"></a>[3] OpenAI GPT-5.6 models / pricing. OpenAI Developers. GPT-5.6 Sol, Terra and Luna official API prices; Sol cached input price. https://developers.openai.com/api/docs/models/compare

<a id="ref-4"></a>[4] Claude Sonnet 5. Anthropic. Official price page; cache mechanics are sourced separately from Anthropic prompt-caching docs, where cache reads are billed at 0.1× input. https://www.anthropic.com/research/claude-sonnet-5

<a id="ref-5"></a>[5] Claude Opus 5. Anthropic. Official $5/M input and $25/M output pricing. https://www.anthropic.com/news/claude-opus-5

<a id="ref-6"></a>[6] DeepSeek Models & Pricing. DeepSeek API Docs. V4 Flash / Pro peak and off-peak input, cache-hit and output pricing. https://api-docs.deepseek.com/quick_start/pricing/

<a id="ref-7"></a>[7] DeepSeek V4 Preview Release. DeepSeek API Docs. V4 Pro: 1.6T total / 49B active params; V4 Flash: 284B total / 13B active params. https://api-docs.deepseek.com/news/news260424/

<a id="ref-8"></a>[8] U.S. electricity prices. U.S. Energy Information Administration. 2025 U.S. industrial average electricity price: 8.62 cents/kWh. https://www.eia.gov/energyexplained/electricity/prices-and-factors-affecting-prices.php

<a id="ref-9"></a>[9] OpenAI compute spending / margin. Reuters, 20 Feb 2026. Reports OpenAI 2025 adjusted gross margin fell to 33%; The Information reported inference costs rose fourfold to $8.4B. https://www.reuters.com/technology/openai-sees-compute-spend-around-600-billion-by-2030-cnbc-reports-2026-02-20/

<a id="ref-10"></a>[10] AI company spending breakdown. Epoch AI, 2026. Summarizes Anthropic 2025 revenue $4.5B, inference compute $2.7B and gross margin 40%, based on reported company projections. https://epoch.ai/data-insights/company-spending-breakdown

<a id="ref-11"></a>[11] SyFI TraceLab. University of Washington. Public Claude Code + Codex traces: 8,058 sessions, 114.2B input tokens, 109.2B cached-read tokens, 391.8M output tokens. https://tracelab.cs.washington.edu/

<a id="ref-12"></a>[12] How Do AI Agents Spend Your Money?. Bai et al., arXiv:2604.22750, 2026. Agentic coding can consume ~1000x more tokens than code reasoning/chat; same-task runs vary by up to 30x, driven mainly by input tokens. https://arxiv.org/abs/2604.22750

← Learn