六款餐饮AI同题测评,算账全过,经营诊断只有一家
这份《中国餐饮经营 Agent 能力白皮书 V0.2》由北京餐鸟科技有限公司的餐饮 AI 经营能力测评项目组发布。它做了一件行业里少有人做的事:把六款餐饮 AI 拉到同一张考卷前直接开考。
同题、同数据、同顺序、同评分规则,原始回答先封存、后审计。被测的六个样本是餐剑、窄门餐谋、红餐 AI、奥琦玮老板助手、袋鼠参谋和食悟 AI。
结果很有意思:算账这项能力六家全部过关,但"为什么赔钱"这一项,只有一家过线。
下面按八条线索,把这份白皮书拆开讲。

图源:《2026餐饮经营Agent能力白皮书》(第2页) · 下载报告全文
一、六款餐饮 AI,被拉到同一张考卷前
先说清这份白皮书是怎么测的。它不是开放式体验评价,也不是看宣传材料推断能力。它用的是统一标准化直接测评:不同产品面对同一个经营场景、同一组关键数据。
除协议预设的多轮题外,不给产品追加任何评分提示;产品错误、测试者错误和运行环境错误分开记录。规则也很硬。首个正式样本开测之后,题目、数据、标准答案和评分门槛都不允许临场修改。
被测的六个样本点名公开:餐剑、窄门餐谋、红餐 AI、奥琦玮老板助手、袋鼠参谋、食悟 AI。报告特意强调,这是按研究目的筛选出的目的性样本,不是随机代表性抽样。
我们在整理《前哨科技AI生态报告:46%企业规模化用AI,但仅9%觉得值》时也碰到过类似的分歧,那里的结论可以拿来对照。
换句话说,六家的表现只能说明这六家到什么水平,不能外推成中国餐饮 AI 的平均水平。另一个关键边界是真实性层级。报告把测试分成 R0 到 R4 五层,从仿真经营题一路到真实动作与结果。
本轮 Q1 到 Q8 主要落在 R0 仿真经营题和 R1 真实经营问题这两层。
报告说得很直接:统一冻结数据保证了可比性,但不能被表述成六家在真实门店里的长期实战。

图源:《2026餐饮经营Agent能力白皮书》(第4页) · 获取《2026餐饮经营Agent能力白皮书》完整版
二、一张图看懂 G-D-C-A-T 能力模型
这份白皮书最有价值的产出,其实是一套可讨论、可验证的能力框架。报告把它拆成五层,缩写是 G-D-C-A-T。G 是经营目标与约束,回答"为什么干、什么不能碰",涵盖利润、现金、营业额、服务和复购的目标与红线。
D 是四项运行底座条件,回答"有没有条件干",包括数据连接与质量、经营数据语义、持续状态与记忆、工具与权限。C 是六项经营能力,回答"会不会经营",也就是测量、分析、发现、诊断、预测和决策。
A 是四项 Agent 运行能力,回答"能不能持续干",包括持续取数、主动发现、系统执行和结果闭环。T 是可信约束,回答"什么时候必须停",涵盖证据、不确定性、因果、权限、风险、追溯、人类控制和澄清。
报告特别提醒一点:G-D-C-A-T 首先是架构依赖关系,不等于研发资源要机械按这个顺序排期。但有一条不能省:T 要贯穿 D、C、A 的全过程,而不是最后才补上。
报告的判断是:如果 C1 到 C6 的经营判断还不稳定,就不应急着把更多高风险动作自动化。

图表来源:《2026餐饮经营Agent能力白皮书》(第8页) · 获取《2026餐饮经营Agent能力白皮书》完整版
三、算账这件事,六家全部过了线
先看表现最好的那一项,也就是 C1 经营测量。它回答的是最基础的问题:这家店现在到底经营得怎么样。利润、成本率、保本点、边际贡献这些数字,必须口径正确、关键成本不漏、前后能闭合。
结果相当整齐:6 个样本全部达到 3 级或以上,其中 3 级 4 家、4 级 2 家,通过率 100%。描述性均值是 3.33,是六项能力里最高的一项。报告的解释是,这说明本组样本在经营测量上的一致性更强,已经显示出较明确的经营辅助潜力。
不过它也标了前提:这个结论建立在"规定数据和口径已经由测试者提供"之上。一旦变成多轮对话、跨期口径或者新证据重算,稳定性仍可能出问题。
换成大白话说就是:给它一份算好的账,六家都算得对;让它自己长期维护这本账,还没验。
四、分析、发现、预测,三项能力分成三档
接下来三项能力,表现明显拉开了层次。C2 经营分析,回答"结果为什么变成现在这样,从结构上看谁贡献了多少"。它的通过率是 50%,三分之一样本过线,均值 2.83。
报告点出了一个容易看错的地方:均值看着接近 3 级,实际却是一半很强、另一半明显低于可用线。C3 异常发现,回答"老板不说哪里有问题,AI 能不能自己找出来"。
这一项在 5 个有效样本里 全部过线,通过率 100%,均值 3.20。有一个样本因为测试入口无法完整承载冻结数据,正式状态记为"待验证",不进入均值和通过率计算。
C5 预测模拟,回答"如果价格、人员、促销、营业时间改变会怎样"。它的通过率也是 50%,均值 2.33,明确规则下的 What-if 有 3/6 过线。
这三项合起来说明:数据已经结构化喂给它的前提下,能发现异常的产品,比能解释结构的产品多。

图表来源:《2026餐饮经营Agent能力白皮书》(第9页) · 下载报告全文
五、最扎眼的一块短板:经营诊断只过一家
现在看整份报告最值得记住的那组数字。C4 经营诊断,回答的是"为什么发生"。它的通过率只有 16.7%,也就是 6 个样本里只有 1 家过线,另外 5 家都停在 2 级。
描述性均值 2.33,报告直接把它定义为"本组六样本最集中的共同瓶颈"。有意思的是失败的方式,不是完全不懂因果边界。报告的原话是:常见问题不是完全不知道因果边界,而是先承认证据不足,随后又为了把答案讲完整而补原因、补参数。
最后把相关关系一步步升级成了因果。这正好踩在 T3 因果边界这条可信约束上——同时发生、统计相关、候选原因和已验证原因必须分开。
报告还有一条判据很关键:证据不足时能停在"无法确认"或"待验证假设",本身就是成熟能力的一部分。
所以这一项的短板不是算力,而是"忍住不乱解释"的纪律。
六、会算不等于定得准,C6 均值最低
再往下是最难的一环:C6 决策优化,回答"现在到底怎么办"。它要求的不只是给建议,还要在利润目标、投入上限、服务红线这些硬约束下真正做选择。
并且要说明优先级、试验周期、观察指标、停止条件和回滚机制。结果只有 2/6 过线,通过率 33.3%,描述性均值 2.17。这是六项经营能力里均值最低的一项。
报告还揭示了一层更难的难度:单轮会做方案,与新证据回来以后还能持续判断对,是两件事。它专门设计了 Q8,在第 60 天新证据出现、且与原预测不同之后,要求重新计算、反思和调整。
需要说明的是,这个第 60 天新证据是题面设定的,不是六家产品真的运行了 60 天。所以它只能测出新证据回流后的认知改判能力,不能直接证明 A4 结果闭环达到 3 级。
报告点出的方向是:决策优化要走向小范围试验、明确期限、可停止、可回滚,而不是一上来就动大手术。

图片来源:《2026餐饮经营Agent能力白皮书》(第10页) · 阅读原文与全部图表
七、四项 Agent 运行能力,六家集体"待验证"
最后是最容易被误读的一段结论。A1 持续数据获取,看的是数据能不能自己来;A2 主动发现与提醒,看的是没人问的时候它会不会自己检查。
A3 系统执行,看的是动作能不能真的送进业务系统;A4 结果跟踪与闭环,看的是做完以后它会不会自己回来复盘。这四项能力,六个样本的状态统一是 "待验证"。
原因是本轮没有取得足够的 R3 真实系统环境和 R4 真实动作结果证据。报告特别强调,"待验证"不是 0 分,也不是"没有能力",只代表本轮没有形成满足条件的有效证据。
同样,产品自述也不能当能力证据——自述只能用来做"声明—实证"对照。报告还给了四条红灯规则:出现 SE1 方向性错误、SE2 决策翻转错误或 SE3 关键经营量严重失真时,该题核心结论不能标"可用"。
顺着这个逻辑往下推,《浙商证券餐饮30年复盘:连锁化率仅25%》给了一组可以互相验证的数字。
如果错误输出还被下游继续使用且没有独立纠正,依赖它的下游结论也不得达到 3 级。
报告的判断是:困难正从"会不会算",转向"算清楚以后能不能守住边界、忍住不乱解释"。
八、老板自己怎么验一个餐饮 AI:先做"五验"
框架讲完,报告把结论落成了一张给经营者用的快速检查卡。第一验,拿一份你知道答案的经营账让它算,看利润、成本率、保本结果对不对,口径不清时它会不会先问。
第二验,给它一段连续经营数据,不告诉它哪里有问题,看它能不能挑出真正重要的 2 到 3 个异常并排好优先级。第三验,问它"为什么",再追问"证据在哪里",看它在证据不足时会不会主动降级。
第四验,给两个真实方案和硬约束,让它必须选一个,看它是否真的计算后做选择,并说明停止条件和回滚方式。第五验,如果它声称自己是 Agent,就停止主动提问,看它会不会自己回来。
报告说,前四验主要看"会不会判断经营",第五验才开始检验"是不是真的像一个 Agent 持续工作"。想继续看餐饮、零售和数字化方向的完整报告与方案,可以到运营动脉(www.yydm.cn)检索。
整份白皮书最该记住的一句话是:餐饮经营 Agent 不会因为被叫作 Agent 就自然成熟。
这份白皮书测了哪六款产品?
被测的六个样本是餐剑、窄门餐谋、红餐 AI、奥琦玮老板助手、袋鼠参谋和食悟 AI。报告说明,它们是按研究目的筛选形成的目的性样本,并非随机代表性抽样;未进入本轮测试不代表产品能力较弱。
换个角度看同一件事,《硕远餐饮品牌化报告:5万亿盘子,800万门店的数字化淘汰赛》算的是另一笔账。
本轮用的是统一标准化直接测评:同题、同数据、同顺序、同评分规则,原始回答先封存后审计,首个正式样本开测后题目、数据、标准答案和评分门槛不得临场修改。
什么是"3 级真实经营辅助可用线"?
报告把能力分为 0 到 5 级的有序等级。3 级的定义是:在限定任务和明确输入边界内,核心任务和主要结果基本可靠,可以进入真实经营辅助,但重要经营判断仍需人最终复核。
报告强调,3 级不是"AI 已经可以独立经营"。它首先要求核心任务完成、关键数字和方向没有被严重错误翻转,允许存在局部问题,但这些问题必须可识别、可限制或可通过经营者复核控制。
C1 到 C6 六项经营能力的通过率分别是多少?
C1 经营测量 6/6 达到 3 级可用线(100%),描述性均值 3.33;C2 经营分析 3/6(50%),均值 2.83;C3 异常发现 5/5(100%),均值 3.20。后面三项明显更低:C4 经营诊断只有 1/6 过线(16.7%),均值 2.33;C5 预测模拟 3/6(50%),均值 2.33;C6 决策优化 2/6(33.3%),均值 2.17,也是六项里均值最低的一项。
为什么六个样本的 A1-A4 都写"待验证"?
因为本轮标准化聊天测试没有取得足够的 R3 真实经营系统环境和 R4 真实动作与结果证据。报告认为,聊天问答不能替代真实运行实证,产品自述的自动取数、主动提醒、执行或闭环也不能直接写成已验证 3 级。
报告同时强调,"待验证"不等于 0 分,也不表示产品没有这项能力,它只代表本轮没有形成满足协议条件的有效直接证据。
为什么白皮书不公布单个产品的总分排名?
报告给了两条理由。一是 0 到 5 级是有序能力等级,不同能力的经营风险并不等权,严重错误也不能被其他高分平均覆盖,因此不生成单个产品的简单总平均排名。
二是六样本规模较小、能力特征明显,跨能力单样本矩阵容易形成"能力指纹"并被反向识别。因此公开版改为分项统计,只展示每项能力的有效样本数、等级分布、达到 3 级比例和描述性均值。
六个样本能代表中国餐饮 AI 的平均水平吗?
不能。报告明确,六个样本属于按研究目的筛选形成的目的性样本,不是随机代表性抽样,不能把六样本均值外推成"中国餐饮 AI 平均水平",也不能把一次测试写成产品的永久能力结论。
报告还列出了几条明确不做的判断:不能把均值最高的能力理解为经营上最重要的能力,不能把标准化测试表现好直接写成已经能够接管真实门店,也不能把"待验证"写成 0 分或"没有能力"。
延伸阅读
这几篇报告解读和本文互为补充,看完能拼出更完整的一张图。
《艾瑞企业级AI Agent报告:2030年市场815亿》——同一批数据支撑的另一个视角
《Skill蓝皮书2026》——2026年Q1,Agent Skills生态经历了一场从量变到质变的爆发。
《硕远咨询餐饮成本报告:原材料占比最高》——重点是原材料占比最高,四大降本路径破解利润困局
声明:除非特别标注,否则均为本站原创文章,转载时请以链接形式注明文章出处。如若本站内容侵犯了原著者的合法权益,可联系本站删除。




