电脑桌面
添加运营动脉到电脑桌面
安装后可以在桌面快捷访问

迈向Token服务新范式-从评测到调度的全链路优化供给.pdf会员免费

迈向Token服务新范式-从评测到调度的全链路优化供给.pdf_第1页
1/46
迈向Token服务新范式-从评测到调度的全链路优化供给.pdf_第2页
2/46
迈向Token服务新范式-从评测到调度的全链路优化供给.pdf_第3页
3/46
迈向Token服务新范式-从评测到调度的全链路优化供给.pdf_第4页
4/46
迈向Token服务新范式-从评测到调度的全链路优化供给.pdf_第5页
5/46
迈向Token服务新范式-从评测到调度的全链路优化供给.pdf_第6页
6/46
迈向Token服务新范式-从评测到调度的全链路优化供给.pdf_第7页
7/46
迈向Token服务新范式-从评测到调度的全链路优化供给.pdf_第8页
8/46
迈向Token服务新范式-从评测到调度的全链路优化供给.pdf_第9页
9/46
迈向Token服务新范式-从评测到调度的全链路优化供给.pdf_第10页
10/46
迈向 Token 服务新范式——从评测到调度的全链路优化供给演讲人:冷静文上海交通大学 计算机学院副院长

Token 调用量高速增长全球日均 Token 调用量统计中国官方统计 Token 日均调用量2024年初 至 2026年3月中国Token调用量增长约 1,400 倍2024年初 至 2026年3月全球日均Token调用量增长约 300 倍来源:基于openai/google/openrouter等平台披露估计来源:国家数据局 / 国新办公开披露;2026.03月 >140 万亿2024初 估算0.5-260-130180-380300-60001503004506002025.06 估算2025底 估算2026.03估算2024初0.130100>140050100150万亿 / 日2025.062025底2026.03万亿 / 日

Token 调用量增长分析Token 增长主要来自 AI 工作流的自我消耗Agent 化、编程智能体、多步骤执行、中国模型供给扩张,共同把 Token 从交互用量推向生产用量来源:Token 使用增长分析报告,OpenRouter Apps / Rankings,Anthropic 成本预估变化及国家数据局公开讲话结构性变化从回答问题转向规划、调用工具、执行任务第一驱动典型场景任务形态供给扩张Top 10 应用中占 87.1%占 Agent Token 的 41.4%上下文、多模态和多 Agent 协作中国厂商贡献约 68% 周 Token 量 OpenRouter单 Agent 平均为非 Agent 的 4.5 倍代码读取、修改、测试持续放大调用量性价比优势推动全球接入把一次任务拆成多轮工具调用

Token 服务形式的优势成本低,门槛低训练和部署大模型的成本动辄几十万、几百万甚至更多;Token 按调用计费,几乎不需要硬件投资通过 API 即可使用,开发者只需几行代码Token 服务形式的优势安全,合规可控Token 供应商通常会做多层安全防护、数据隔离、输出内容合规审查对开发者而言,避免了自己部署模型可能带来的安全风险快速迭代,即开即用模型升级、优化全由服务方完成,用户可直接享受最新能力无需关注复杂的模型部署和性能优化问题可扩展性强模型升级、优化全由服务方完成,用户可直接享受最新能力无需关注复杂的模型部署和性能优化问题用户专注业务,而非技术细节开发者把精力放在业务逻辑、产品设计和数据处理上而不是底层模型推理实现通过云平台将大模型封装为 Token 调用服务,是人工智能目前的主要服务模式

中国是Token服务发展的沃土—政策支持“培育人工智能应用服务商,发展‘模型即服务’、‘智能体即服务’等,打造人工智能应用服务链”国务院发文《关于深入实施“人工智能+”行动的意见》,指出2026年4月:工信部“模数共振”行动2026年3月 十五五规划纲要

中国是Token服务发展的沃土-市场环境中国拥有世界上最繁荣的开源模型生态智算中心、智算集群建设加速推进中国 AI 算力近年来持续增长供给侧需求侧通过 Token 调用使用 AI 大模型用户日益增多企业开发者个人开发者科研人员普通消费者

中国Token服务现状「 从一个异常发现说起 」

便宜模型的账单悖论引发警觉开发者很喜爱的claude code,调用便宜模型,实际费用异常偏高,打破了"单价低则成本低"的直觉认知按某用户当天计费日志做样本(该模型当天 148 次请求)0.20.40.60.81.00反常现象:便宜约4倍的模型,单次花费却和旗舰打平单次成本0.90元单次成本0.92元≈同为当天真实请求 | 柱高=单次平均成本| 柱内配色=输入侧缓存构成输入侧构成缓存未命中(全价)缓存命中(打折)写缓存一眼看懂两根柱几乎一样高 = 单次花费打平。但便宜模型76%是红色全价、旗舰98%是绿色打折——单价本该便宜4倍,全被「未命中缓存」抹平了。76%22%98%便宜模型原始单价≈旗舰的1/4旗舰模型原始单价(基准)单次成本

为什么会存在这样的情况?• 进一步排查发现:同一个会话的多轮请求,缓存命中率极低 -提示词中有计费内容块,其中包含一个每轮都在变化的cch值,导致缓存无法命中(Claude Code,自版本 2.1.36 起)为了计费归因,会在请求的提示词最前面注入一段计费内容块会处理的服务商•处理前自动剥离该计费内容块•结果:即使 cch 每轮变,服务商看到的缓存前缀仍然稳定 → 命中正常。不处理的第三方服务商•把含变化的cch的完整前缀当成缓存 key •...
Token服务范式报告:日均140万亿调用量,Agent吃掉87%

全球Token调用量正经历一场指数级的结构性膨胀。上海交通大学计算机学院副院长冷静文在AiCon大会上发布的《迈向Token服务新范式——从评测到调度的全链路优化供给》报告,46页,以一组令人警醒的数据锚定了这一变化:2024年初至2026年3月,全球日均Token调用量增长约300倍,中国增速更达1,400倍,日均调用量已突破140万亿。

一、Token增长的驱动力已从"交互用量"转向"生产用量"

报告揭示了一个关键的驱动迁移:Token增长的主要来源已经不是人类与AI的对话交互,而是AI工作流的自我消耗——Agent化、编程智能体、多步骤执行与中国模型供给扩张,共同将Token从"交互用量"推向"生产用量"。

具体数据精准刻画了这一结构性转变:Agent占Token使用总量的87%,其中编程Agent又占Agent Token的41.4%。OpenRouter的数据显示,单Agent的平均Token消耗量是非Agent的4.5倍。代码读取、修改、测试的持续放大效应,把一次任务拆解为多轮工具调用,Token消耗量呈几何级增长。

在供给侧,中国厂商贡献了约68%的周Token量,Top10应用中占87.1%。中国模型的性价比优势正在推动全球范围的接入,Token生态的中心正在从模型训练侧向模型调用侧迁移。

二、"便宜模型的账单悖论":单价优势被缓存命中率抹平

报告提出了一个极具商业洞察力的"异常发现":开发者调用看似便宜4倍的模型时,实际账单却与旗舰模型持平。拆解计费日志后发现,便宜模型76%的输入请求因缓存未命中而按全价计费,而旗舰模型高达98%的输入享受缓存命中折扣。单价便宜4倍的模型,单次花费竟然与旗舰模型打平——"单价低则成本低"的直觉认知在这个悖论面前被彻底粉碎。

查看完整解读

1、当您付费下载文档后,您只拥有了使用权限,并不意味着购买了版权,文档只能用于自身使用,不得用于其他商业用途(如 [转卖]进行直接盈利或[编辑后售卖]进行间接盈利)。
2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。
3、如文档内容存在违规,或者侵犯商业秘密、侵犯著作权等,请点击“违规举报”。

查找下载文件的指引

一、电脑端

- Windows 系统:按下键盘快捷键 `Ctrl + J`,即可打开下载列表。  

- Mac 系统:按下键盘快捷键 `⌘ + J`,即可打开下载列表。  

二、手机端

1. 打开手机浏览器,点击浏览器右下角的 “≡”(或“更多”)图标。  

2. 在弹出的菜单中找到并点击 “下载内容”(或类似选项),即可查看已下载的文件。  

提示:不同浏览器界面略有差异,若未找到“下载”入口,可尝试在浏览器设置中搜索“下载”关键词。


迈向Token服务新范式-从评测到调度的全链路优化供给.pdf

萤火报告 + 关注
实名认证
内容提供者

聚焦行业热点,提供深度分析与实用报告,照亮你的决策之路。

文章解读

全球Token调用量正经历一场指数级的结构性膨胀。上海交通大学计算机学院副院长冷静文在AiCon大会上发布的《迈向Token服务新范式——从评测到调度的全链路优化供给》报告,46页,以一组令人警醒的数据锚定了这一变化:2024年初至2026年3月,全球日均Token调用量增长约300倍,中国增速更达1,400倍,日均调用量已突破140万亿。

一、Token增长的驱动力已从"交互用量"转向"生产用量"

报告揭示了一个关键的驱动迁移:Token增长的主要来源已经不是人类与AI的对话交互,而是AI工作流的自我消耗——Agent化、编程智能体、多步骤执行与中国模型供给扩张,共同将Token从"交互用量"推向"生产用量"。

具体数据精准刻画了这一结构性转变:Agent占Token使用总量的87%,其中编程Agent又占Agent Token的41.4%。OpenRouter的数据显示,单Agent的平均Token消耗量是非Agent的4.5倍。代码读取、修改、测试的持续放大效应,把一次任务拆解为多轮工具调用,Token消耗量呈几何级增长。

在供给侧,中国厂商贡献了约68%的周Token量,Top10应用中占87.1%。中国模型的性价比优势正在推动全球范围的接入,Token生态的中心正在从模型训练侧向模型调用侧迁移。

二、"便宜模型的账单悖论":单价优势被缓存命中率抹平

报告提出了一个极具商业洞察力的"异常发现":开发者调用看似便宜4倍的模型时,实际账单却与旗舰模型持平。拆解计费日志后发现,便宜模型76%的输入请求因缓存未命中而按全价计费,而旗舰模型高达98%的输入享受缓存命中折扣。单价便宜4倍的模型,单次花费竟然与旗舰模型打平——"单价低则成本低"的直觉认知在这个悖论面前被彻底粉碎。

这一发现的深层含义在于:Token经济的成本优化逻辑,正在从"选更便宜的模型"转向"选对模型+优化缓存命中+合理调度"。报告立足于此,提出了一套从评测到调度的全链路优化框架。

三、Token服务的五大优势构建了不可逆的基础设施定位

报告系统梳理了Token服务形式的五大核心优势:安全合规可控(多层次安全防护与内容合规审查)、快速迭代即开即用(模型升级由服务方完成,用户无需关注部署细节)、成本低门槛低(按调用计费,几乎不需要硬件投资)、可扩展性强(弹性伸缩,无需预置算力)、开发者聚焦业务逻辑(无需关注底层模型推理实现)。这五大优势构成了Token服务不可逆的基础设施属性——正如云计算取代了自建IDC,Token服务正在取代自建模型部署。

四、政策与市场双轮驱动:中国Token生态的制度性加速

报告用一整节梳理了政策层的制度支撑。2026年3月"十五五"规划明确"强化算力算法数据高效供给",2026年4月工信部推出"模数共振"行动,要求每家央企至少选择一个重点行业、构建不少于5个行业通识数据集、研发不少于1个行业模型。国务院"人工智能+"行动意见提出发展"模型即服务、智能体即服务"。

这些政策信号叠加中国繁荣的开源模型生态、持续增长的AI算力供给、以及企业开发者、个人开发者、科研人员与普通消费者构成的多层次需求体系,形成了一个完整的Token供需闭环。报告将中国定位为"Token服务发展的沃土",这一判断建立在供给侧算力增长、需求侧Token渗透率提升、制度侧政策密度加大的三重支撑之上。

五、从"评测"到"调度":全链路优化的核心命题

报告的主线逻辑清晰而直接:当前Token服务的核心瓶颈已经从"有没有模型、模型好不好"转移到了"如何在一个多模型、多供应商、多场景的环境中,实现从评测选择、到动态调度、再到成本效率优化的全链路闭环"。"便宜模型的账单悖论"只是这个更大命题的一个切片——当Agent工作流把单次任务拆解为数十轮调用、当Token量以300倍的速度膨胀,任何一个环节的效率损失都会被急剧放大。

报告最后落脚在一个明确的趋势判断上:Token服务的竞争,正在从模型本身的竞争,转向模型评测+动态调度+成本优化三位一体的系统能力竞争。对于从业者而言,理解并布局这一范式转换,是把握Token经济红利的先决条件。

查看完整解读
确认删除?
会员
教程
收藏
足迹
联系
  • 站长微信
回到顶部