在上一周于工作中使用过 AI 的美国劳动者中,56% 节省的时间为两小时或更少。13% 完全没有节省时间,或者需要额外时间才能完成工作(U.S. Census Bureau, 2026;Nextgov/FCW, 2026)。
这是首次由联邦政府主导、独立于供应商的关于职场 AI 节省时间的测量。它不是许可证推销,不是客户成功团队导出的遥测数据,也不是由卖席位的公司所做的调查。对于正在编制 2026 年 AI 商业论证的运营负责人而言,它回答了一个供应商数据在结构上无法回答的问题:中位使用者究竟拿回了多少。
答案是一到两小时。问题不在于这个数字小。问题在于,零散的一两个小时并不是你商业论证所使用的计量单位。
普查局究竟测量了职场中 AI 节省时间的什么
2026 年 3 月的 Household Trends and Outlook Pulse Survey 于 8 月 11 日发布,向在职受访者询问他们是否在 11 项具体工作任务中的任意一项使用过 AI。约 55% 回答"是"(Census Bureau, 2026)。
这份任务清单值得细读,因为它描述的是真实采用的形态,而不是路线图的形态:
- 37%——查找信息或技术帮助
- 32%——撰写沟通内容、文档或说明
- 32%——产生创意
- 31%——解释、翻译或概括信息
- 27%——行政事务
这些都不是"智能体式"的。它们是检索、起草与压缩——知识工作中可被替代的中间层,而不是大多数 2026 年部署计划所围绕的端到端流程所有权。
接下来是时间问题。在上一周使用过 AI 的劳动者中,分布如下:25% 节省不到一小时,31% 节省一到两小时,约 30% 节省三小时及以上(大致平均分布于三小时与四小时及以上之间),10% 完全没有节省时间,3% 表示使用 AI 后工作耗时反而更长(Census Bureau, 2026;CBS News, 2026)。
一条对内部引用方式很重要的方法学说明:普查局的问题锚定在上一周完成的任务上,而不是每人一个干净的周度总量。若说有偏差,这种设定反而是宽松的。使用强度也比采用率标题所暗示的更薄——在参考周内,只有 24% 的 AI 使用者每天都用,46% 至少用过一天。
两次独立的联邦读数,一个数字:约两小时
这套数据最有用的特征,是它已是第二个落在几乎同一位置的联邦口径测量。
Bick、Blandin 与 Deming 的全国代表性调查——即 St. Louis Fed 采用率研究的基础——询问生成式 AI 使用者:若没有 AI,完成上一周的工作还需要多少额外小时。答案是工作时间的 5.4%,即在 40 小时工作周中约 2.2 小时(St. Louis Fed, 2024)。
两套不同的工具、两个不同的年份、两种不同的提问设计。二者都落在约两小时。
而多数人恰恰把下面这一点读反了:供应商在这个数字上其实也没错多少。Forrester 关于 Microsoft 365 Copilot 的 Total Economic Impact 研究,其价值引擎建立在每位使用者每月约节省 9 小时之上——约合每周 2.25 小时——却仍得出其复合型组织 116% 的投资回报率,三年内 3,680 万美元收益对 1,710 万美元成本(Forrester, 2025)。
所以,联邦数据与供应商模型之间的分歧不在小时数,而在一小时值多少钱。而这是一个属于你的建模假设,不是供应商能替你验证的假设。
你的商业论证在小时数上没错。它错在这些小时是什么。
标准算式是:节省小时数 × 全成本时薪 × 人数。它干净利落,能通过财务评审,并且以一种非常具体的方式出错:它假定收回的时间与购买的时间可以互换。
并不能。每周两小时,摊在十几项被打断的任务上,那是冗余时间(slack)。它会被工作日吸收——稍早一点结束、稍长一点的评审、周末前稍轻一点的赶工。它不会汇聚成可重新配置的产能增量,因为运营模式中没有任何机制被设计来收集它。在一家 200 名全职员工的公司里,没有任何机制能把四十个人零散的九十分钟扫拢成一个有预算的项目。
这是宏观结论的中型市场版本。Acemoglu 对 AI 总体效应的任务级核算——受影响任务占比乘以每项任务的平均成本节省——得出的结果是十年内全要素生产率提升不超过 0.66%,原因恰恰是:在一小部分工作上取得可观的单任务节省,并不会按照直觉所要求的方式加总(Acemoglu, 2024)。你的损益表在更小的尺度上运行着同一套算术,结果也相同。
运营层面的检验既是二元的,也不留情面:是否有一整项任务离开了某个人的案头?
如果一项月度对账、一个初稿周期、一类一线工单或一份报告的搭建现在被完全吸收——那是产能,并且可以入账。它会表现为一个你不再补员的空缺、一个你不再续约的外包、一条无需加班即可清空的队列。反之,如果每项任务仍然需要一个人,只是各自快了一点,那你买到的是"舒适"。舒适是正当的采购。但它不是成本项,本就不该被建模成成本项。
没人定价的那 13%
10% 的 AI 使用者没有节省时间。3% 花的时间比不用 AI 时更多(Nextgov/FCW, 2026)。
我没见过哪份中型市场的商业论证会带上负尾部。我审阅过的每一个模型,都把节省视作以零为下限、向上分布。联邦数据说:大约每八位使用者中就有一位处于零或以下——而这些人照样消耗一份许可证、一个培训名额和管理者的注意力。
这重新定义了部署广度的问题。按固定席位价的全员铺开,买到的是整个分布,包括其最低的八分之一。而针对分布上端任务画像的定向铺开——高频率起草、概括、信息检索密集型岗位——买到的是被截断的分布。在 500 个席位上,这两条曲线之间的差异就是整个 ROI 论证,而它由采购范围决定,不由技术决定。
反对意见:"我们的试点结果比这高得多"
大概率确实如此。有两个结构性原因,在外推之前都值得记住。
试点是按热情筛选的。 AI 试点的志愿者来自普查局刚刚发布的那个分布的右尾——即拿到三小时及以上的那 30%。推广到全体人员会把你推向中位数,而不是试点均值。一个每位参与者每周产出四小时的试点,并不预测每位员工每周四小时;它预测的是上限。
自报的节省时间是对反事实的估计。 普查局与 St. Louis Fed 的工具都要求人们想象"没有 AI 时这项工作要花多久"。这是一项困难的认知任务,而且并不能明显判定其偏差方向向下。这里没有任何东西能纠正自报高估的可能性。
这两点都不意味着技术表现不佳。它们在运营上意味着同一件事:你的商业论证应当建立在完整人群的中位数之上,并在最低十分位做压力测试——而不是建立在试点队列之上、靠期望向前外推。
本季度结束前的三个决定
- 把模型的计量单位从小时改为任务。 拿出当前的 AI 商业论证,找出每一处把节省小时折算成金额的条目。对每一条,点名那项已经离开某个具体人案头的具体任务。通过这一检验的条目保留。无法点名任务的条目,从成本节省重新归类为质量或体验收益——真实、值得投入,但不再承载 ROI。
- 把最低八分之一明确定价。 为净值为零或为负的那约 13% 使用者单列一行。乘以席位全成本加上赋能成本。如果这一行实质性改变了你的回本周期,答案是收窄部署范围,而不是更好的提示词库。
- 在续约前对一条流程做端到端度量。 选一个高频率、边界清晰的工作流。测量前后的周期时间与经手人数——在流程层面,而非个人层面。一次干净的流程级测量,胜过一整年的自报小时数,而且它是唯一能区分冗余时间与产能的证据。
续约之前值得问的问题
普查局的贡献不在于说明 AI 节省的时间很少。在一支采用率为 55% 的劳动力中,超过一半的人每周省下两小时,这是真实而广泛的收益,并且与独立的联邦估计相互印证。
它的贡献在于:这个数字现在是公开的、非商业的,并且稳定到足以据此做规划——这也就取消了最后一个借口:把零散的分钟数乘以全成本时薪,然后把结果称作产能。
签下续约之前,向团队提一个问题,并要求得到一个名称而非一个数字:哪一项任务已经不再需要人?如果没人答得上来,那么今年你买到的不是产能,而是稍微轻松一点的一周——而这件事,最好在财务从差异报告里发现之前你就知道。