人工智能体(AI Agent)在电子表格工具中的用途多样。有些代理编写公式,有些在工作簿内操作,有些分析上传的文件,还有一些将多个导出文件整合为报告或仪表盘。
这些功能都很实用,但不应仅凭一个模糊的排名来评估它们。你的团队需要了解一个代理能访问什么、会修改什么、其工作如何被审核,以及最终输出是否适合下一个业务决策。
本指南版本包含了全部七个代理类别的录屏界面证据、可见的脏数据前后对比测试、三个观察到的失败案例、一个10秒的工作流视频,以及一个可下载的测试工作簿。此外,本指南还公开了存在的空白:Copilot、Gemini 和 ChatGPT 并未在同一测试夹具上独立运行,因此本文不声称任何跨供应商的速度或准确性排名。
关键要点:
- 当工作簿本身是交付物时,使用工作簿原生代理;当工作从多个导出文件开始、以经过审核的报告或仪表盘结束时,使用文件到报告代理。
- 一个可信的代理测试应包括:一个已知重复项、一个混合格式日期、一个缺失键、一个模糊标签,以及一个独立计算的控制合计。通过测试意味着不仅要匹配合计,还要暴露异常。
- 声明的文件大小限制并非性能结果。对于50 MB的CSV,应衡量解析成功性、行数核对、首次可用输出的时间,以及同一提示在第二次运行中是否产生相同的分组合计。
- 匡优数言专为基于文件的分析和报告设计;Microsoft Copilot 和 Gemini 更适合在 Excel 或 Sheets 内部工作;当实时刷新和受控指标成为主导时,BI 是更合适的目的地。
- 观察到的匡优数言运行发现了有用的输出和真正的缺陷:一次清洗后仍然存在混合日期类型,一项审计答案对未解释的
53,250残差进行了推测,而生成的工作簿中包含需要修复的图表。
什么是电子表格 AI 代理?
在本指南中,电子表格 AI 代理 是一种能够根据指令将多步电子表格任务导向输出的工具。它可以检查列、建议转换、生成公式、创建图表、起草说明或准备报告。
这并不意味着不再需要审批。代理可以建议类别映射或公式,但负责报告的人仍然拥有定义和结果的所有权。
本指南的证据与测试范围
本指南将三类通常在 AI 工具列表中混为一谈的证据区分开来:
- 观察到的产品工作流: 下方的匡优数言截图来自本网站仓库中记录的产品演示。它们展示了真实的提示、输出、可下载的工件以及可见的缺陷。部分录屏使用了早期的 Excelmatic 名称;Excelmatic 现为匡优数言,因此品牌标签是历史遗留,但工作流证据仍然有效。
- 供应商文档中的能力: 关于 Microsoft Copilot、Gemini 和 ChatGPT 的陈述是在类别层面描述其产品面貌。它们并非亲测结果。可用性、计划规则和文件限制可能发生变化,因此在购买前请核实当前供应商文档。
- 评估方法: 下文中的 5 MB、25 MB 和 50 MB 测试是一套可复现的协议,并非已发布的跨供应商基准结果。我们未在相同硬件和账户层级上对每个供应商计时,因此本文不声称匡优数言比 Copilot 或任何其他产品更快。
这一界限很重要。一个精美的演示只能证明某个工作流存在,但不能证明每个工作簿、公式链或大型 CSV 都会表现出相同的行为。
七类 Excel 和 Google Sheets AI 代理
1. 公式代理
最佳用途: 将自然语言请求转换为起始公式,或解释现有公式。
适用于用户将在工作簿内测试结果的情况。对于查找逻辑、日期计算、条件公式和公式解释很有帮助。它们不能替代完整的报告工作流。
下方录制的公式代理输出展示了几个 SUMIFS 示例,包括销售额超过 $1,000、某个日期之前的销售额以及包含“转账”描述的条目。

观察到的局限性: 公式以呈现的文本形式显示,而非插入的单元格;截图未显示对源范围的独立重新计算。日期条件也值得审视,因为区域设置以及 10 月 3 日是否包含在内会改变结果。在 Excel 返回预期的控制合计之前,请将这些公式视为候选。
2. 工作簿原生助手
最佳用途: 需要在 Excel 或 Google Sheets 内部获得帮助的团队。
当工作簿或 Sheets 仍然是主要操作界面时,这些代理可能是自然的选择。在允许助手编辑生产工作簿之前,请审查权限、租户设置、功能可用性和更改历史。
本文未在测试夹具上运行 Microsoft Copilot 或 Gemini。最近似观察到的工作簿输出证据是一次匡优数言运行,该运行根据要求生成了一份包含 60 行样本数据(跨越六个月)的提示,生成了一个包含“原始数据”、“KPI 定义”、“数据透视摘要”和“仪表盘”四个工作表的工作簿。

该截图之所以有用,恰恰是因为它不完美。工作簿和表存在,部分图表包含数据,但预览中几个图表区域显示为空或填充不足。工作簿输出代理在文件打开时并未完成;审核者必须重新计算、检查图表源范围、测试筛选器并确认公式在导出后能正常保留。
3. 文件清洗代理
最佳用途: 修复跨导出文件中存在的标签不一致、空白字段、重复记录和结构不匹配。
使用审核表,而不是让代理静默覆盖源值。对“华北”、“华北区”和“华 北”的映射提议需要负责人批准。
以下实际清洗序列从八条可见的非空白记录开始,包含重复的订单 ID、三种日期表示、空白价格、不一致的客户大小写以及空白状态。第一次返回的表显示去重后剩下六条可见记录,但日期仍然混合了文本和 Excel 序列号。

这是一个真实的多步骤失败模式:一次处理改善了一个维度,却使另一个维度仍未解决。第二次提示可以标准化日期和客户大小写,但必须再次检查可见输出是否存在重复回归和缺失值处理。
以下录制的匡优数言运行使用了 Registry.xlsx 和提示:“清洗表中的数据,标准化数据格式,并用 N/A 填充所有缺失值(以红色高亮单元格)。”

结果陈述了它尝试的转换,并提供了可下载的清洗后工作簿。

该证据表明: 产品接受了一个特定于工作簿的指令,描述了转换过程,并返回了一个工件。它未表明: 每个日期和电话号码是否正确映射,合法空白是否应当保持空白,或者相同工作流在 50 MB CSV 上的表现如何。审核者应在接受清洗后文件之前,比较唯一值计数、空白计数、行数和五个抽样记录。
4. 分析代理
最佳用途: 针对清洗过或已检查的表提出问题,比较时间段,查找异常并起草说明。
这些代理适用于探索性工作。请让它们显示分组值、时间段和需要审查的异常,然后再接受结论。
在录制的分析运行中,提示要求匡优数言对 101 条学生记录进行排序,计算平均分,并返回完整数据进行预览。


输出报告平均值为 49.85,标准差为 29.1,但截图未披露标准差的计算约定,也未独立重新计算这些值。“大致处于中等水平”是一种解释,而非计算事实,除非该组织定义了分数段。
5. 图表与仪表盘代理
最佳用途: 从已验证的指标过渡到可视化摘要。
应向代理说明业务问题和目标读者。图表只有在有人检查了聚合、筛选器、标签和解释后才算完成。

显示的四个柱状图合计为 11,240(3,650 + 5,700 + 440 + 1,450)。可视化本身未显示报告期、货币、排除项或源数据对账。这使得 11,240 成为图表显示合计,而非经过审批的销售 KPI。
6. 审计与审核代理
最佳用途: 识别可能的公式不一致、缺失字段、异常值以及报告版本之间的更改。
审计代理创建一个审核队列。它不应未经审查就声称某笔交易或工作簿“错误”。

该运行揭示了具体差异:可见收入 500,000,销货成本 180,000,运营费用 125,000,暗示应为 195,000,而工作簿报告为 141,750。残差为 53,250。回答有用地注意到了差距,但随后通过在没有源头证据的情况下建议“其他扣减”的方式削弱了可靠性。正确的审计状态应为未对账——检查源公式和隐藏依赖项。
7. 文件到报告代理
最佳用途: 以 Excel、CSV、PDF、截图或导出数据开始,需要报告、仪表盘或管理摘要的团队。
匡优数言属于此类别。它帮助团队将杂乱的业务文件转化为答案、报告和仪表盘,并在第一轮需要优化时留有纠正工作流的空间。

仪表盘提供了一个可共享的审核界面,但仅凭截图无法验证 1.31M 的销售额、43 个订单和 30.36K 的平均订单价值是否使用了预期的粒度和筛选器。文件到报告代理仍然需要在叙述之外的控制合计和指标定义。
观察到的执行记录
以下是从实际录制的运行中获得的证据。“未捕获”被保留可见,而不是转换为有利分数。
| 代理类别 | 观察到的夹具或任务 | 可见的具体输出 | 失败或未解决的检查 | 证据评判 |
|---|---|---|---|---|
| 公式 | 五个 SUMIFS 场景 |
公式、计算值和说明 | 未显示源范围重新计算;日期语义需审查 | 部分通过 |
| 工作簿输出 | 提示指定 60 行、六个月、四个工作表 | .xlsx 文件,包含“原始数据”、“KPI 定义”、“数据透视摘要”和“仪表盘” |
几个图表区域看起来为空或不完整 | 工件已创建;展示失败 |
| 文件清洗 | 八条可见源记录,包含重复 ID、混合日期、空白和不一致大小写 | 去重后六条可见行;后续标准化/填充输出 | 第一轮保留混合日期类型;后续轮次需检查回归 | 部分通过 |
| 分析 | 101 条学生记录 | 平均值 49.85,标准差 29.1,排名,叙述,可下载工作簿 |
未捕获公式惯例和独立重新计算 | 结果已观察;准确性未验证 |
| 图表 | 四个产品类别 | 柱状图标记为 3,650、5,700、440、1,450;显示合计 11,240 |
缺少时间段、货币、筛选器和源合计 | 可视化通过;KPI 未验证 |
| 审计 | 净收入公式链 | 检测到可见的 53,250 残差 |
在没有证据的情况下建议“其他扣减” | 差异发现通过;解释失败 |
| 文件到报告 | 销售工作簿到仪表盘 | 筛选器、五个 KPI 卡片、图表和书面洞察 | 未捕获 KPI 粒度和源数据对账 | 工件通过;指标待审批 |
在这些录屏中未捕获任何上传时长、模型 token 使用量、大量语料库中的公式错误率或 50 MB 数据处理结果。这些字段保持未经测试,而非零。
2026 年电子表格 AI 代理仍会失败的地方
失败 1:一个清洗步骤可能使另一步骤退化
脏数据序列展示了为什么“清洗成功”不是足够的状态。去重产生了六条可见行,但日期单元格仍然混合了文本和 Excel 序列值。后续标准化截图显示日期和大小写更干净,但重复 ID 再次可见,因为转换并未被证明是在之前去重的工件上操作的。
控制: 要求在每次转换后提供行数、重复键计数、按列空白计数、不同类别计数和更改单元格样本的前后记录,而不仅仅是在最后。
失败 2:审计代理可能发现差距并虚构桥梁
公式审计运行正确地暴露了 53,250 的残差,然后推测它代表“其他扣减”。这是一个合理的会计叙述,但合理性并非证据。
控制: 强制审计输出使用三个标签:已对账、未对账 或 需要源依赖项。除非明确命名了确切的源单元格或行,否则禁止因果文本。
失败 3:生成的工作簿可以打开但仍然未完成
四工作表工作簿证明了成功创建工件,但仪表盘预览中包含几乎没有可见数据的图表区域。仅仅因为存在 .xlsx 下载,文件就尚未准备好供领导层使用。
控制: 重新打开并重新计算工作簿,检查公式错误,追踪图表源范围,测试筛选器,并在接受前渲染每个输出表。
四种常见工作流
| 团队与工作 | 最佳代理类型 | 所需审查 |
|---|---|---|
| FP&A:月度实际 vs 预算报告 | 文件到报告 + 审计 | 指标定义、科目映射、重大差异 |
| 销售运营:每周管道审查 | 分析 + 仪表盘 | 阶段定义、缺失负责人、过期交易规则 |
| 电商:库存与退货审查 | 文件清洗 + 分析 | SKU 映射、需求期、退货分类 |
| 营销:Google Sheets 活动追踪 | 工作簿原生 + 公式 | 源映射、归因规则、计算字段 |
代理选择应遵循工作流。公式代理可能非常适合营销追踪器,但不适用于月度财务包。
能快速暴露弱代理的边缘案例
最有揭示性的测试行很少是干净行。将这些案例添加到文件的安全副本中:
| 边缘案例 | 弱结果 | 可审查结果 |
|---|---|---|
01/02/2026 与 2026-02-01 并列 |
静默选择一种区域设置 | 标记歧义并询问日期惯例 |
NE、Northeast 和 North East 同时出现 |
自动合并所有值 | 建议映射并保留原始值 |
| 一个订单重复但状态不同 | 删除一行 | 在重复审查表中返回两行 |
| 小计行位于交易数据内部 | 将小计计为另一笔交易 | 检测或询问混合粒度 |
N/A 在一列中表示“不适用”,在另一列中表示“缺失” |
两者均视为空值 | 使用列特定规则 |
| 公式引用隐藏工作表 | 仅解释可见单元格 | 命名未解决的依赖项或请求访问 |
| 50 MB CSV 以截断行结束 | 产生一个看似合理的合计 | 在分析前核对行数和控制合计 |
这些案例使评估不那么整洁,但它们反映了报告负责人实际必须审核的工作。
实用的买家测试,而非通用检查清单
分三轮进行评估。
第一轮:小型夹具上的正确性。 使用 200-500 行匿名数据,包含五个引发问题和一个在 Excel 中计算的控制合计。记录哪些问题被发现、哪些被遗漏,以及合计是否对账。
第二轮:下一期文件的可重复性。 重命名一列,引入一个新类别,并删除一个可选字段。一个有用的代理要么保留已记录的映射,要么停止并请求澄清。对于周期性报告,静默重新映射视为失败。
第三轮:操作规模。 如果您的实际导出文件达到 50 MB,请在相同账户层级和网络条件下测试 5 MB、25 MB 和 50 MB 版本。捕获上传成功率、解析时间、行数、控制合计、响应时间、输出大小和审核者更正。不要将匡优数言上传测试与 Copilot 工作簿测试作为相同数据路径进行比较。
下载脏数据测试工作簿
使用与清洗截图相同的测试夹具:下载 Sales_Data_Cleaning_Test.xlsx。它包含重复的订单 ID、混合日期格式、不一致的客户大小写、空白值和一个空白行。在将文件提交给代理之前,计算预期行数和异常计数。
下面对 10 秒视频展示了从提示到清洗工件的录制工作流。这是一个交互演示,而非计时基准;录屏可能经过编辑,并未隔离服务器处理时间。
将此评估记分卡复制到 Excel 或 Sheets
在加权分数之前使用硬性关口。如果导入行数不一致、重大控制合计错误、或输出静默丢弃被拒绝的行,则代理测试失败。
| 标准 | 权重 | 评分规则(0–5) | 所需证据 |
|---|---|---|---|
| 导入完整性 | 关口 | 仅当行/列计数一致时为 5;否则失败 |
导入摘要和被拒绝行数 |
| 重大控制合计 | 关口 | 仅当所有商定的合计匹配时为 5;否则失败 |
独立的 Excel 计算 |
| 引发问题召回率 | 20% | 发现的问题数 ÷ 引发的问题数 | 带有源行的异常表 |
| 误报控制 | 10% | 5 表示没有有效记录被错误更改 |
审核者处置日志 |
| 数值正确性 | 25% | 分组指标和公式正确 | 计算字段、筛选器和时间段 |
| 可重复性 | 15% | 第二次运行及重命名列夹具时结果相同 | 运行 ID、提示和输出比较 |
| 可审查性与溯源 | 20% | 值可追溯到行、字段、公式或工件 | 源引用和未解决列表 |
| 输出可用性 | 10% | 审核者可在少量或无需修复后使用工作簿/报告 | 更正次数和验收说明 |
在确认两个关口均通过后,将 100 分结果计算为 SUMPRODUCT(分数, 权重) / 5。在分数旁边发布遗漏、失败和“未测试”字段。高分但控制合计失败仍然是一个失败的评估。
对于敏感的财务、薪资、法律或员工级别数据,不要仅为了测试代理而使用实时个人数据。尽可能使用匿名数据,并对需要受控数据边界的工作流评估私有部署。
通用 AI、工作簿助手与匡优数言
以下产品应按操作界面和交付物进行比较,而非单一的“AI 质量”分数。
| 选项 | 代理工作位置 | 最擅长 | 审核界面 | 本文证据 | 需测试的重要边界 |
|---|---|---|---|---|---|
| Microsoft Copilot in Excel | Microsoft 365 工作簿内部 | 公式帮助、工作簿分析以及当 Excel 仍为交付物时的编辑 | 工作簿公式、表格和更改上下文 | 仅供应商文档;未独立执行 | 租户/计划可用性、工作簿结构、外部文件包行为 |
| Gemini in Google Sheets | Google Workspace 工作流内部 | 协作式 Sheets 工作、表格创建、公式、摘要和 Workspace 上下文 | 表单元格、版本历史和共享审阅 | 仅供应商文档;未独立执行 | 功能可用性以及最终业务报告是否必须离开 Sheets |
| ChatGPT 数据分析 | 上传文件的通用聊天 | 快速探索、代码辅助分析和原型 | 对话、生成的表格、代码和可下载工件 | 仅供应商文档;未独立执行 | 可重复性、文件保留策略以及移交到受控报告流程的情况 |
| 匡优数言 | 基于文件的分析和报告工作区 | 需要答案、报告或仪表盘的 Excel/CSV/PDF/图片输入 | 提示、显示的分析、可下载工件以及报告/仪表盘输出 | 七个录制的工作流类别加三个可见失败案例 | 映射更改、模糊定义、大文件行为、审核者更正流程 |
| BI 平台 | 连接到业务系统的受控模型 | 共享指标、计划刷新、权限和广泛仪表盘分发 | 语义模型、刷新日志、沿袭和仪表盘权限 | 仅类别比较;无平台基准 | 实施工作量以及小型导出驱动工作流是否值得模型 |
当业务需求介于工作簿助手和 BI 之间时,匡优数言非常有用:团队有导出的文件,需要可重复的分析和报告工作流,并希望输出供同事审查和共享。探索电子表格助手工作流用于常规文件工作,或参阅业务报告代理指南进行以报告为中心的比较。
有关当前功能详情,请从各供应商自己的文档开始:Excel 中的 Microsoft Copilot、Google Sheets 中的 Gemini 以及 ChatGPT 文件上传常见问题。供应商页面描述了可用性和限制;它们不是独立的性能基准。

运行首次受控测试
从上述可下载的测试夹具开始,并在运行代理之前写出预期结果:
- 八条非空白源记录;
- 两个完全重复的对(
1001和1002),如果移除完全重复项,则剩下六条唯一行; - 以点分隔文本、斜杠分隔文本和类似日期的值表示的日期;
- 订单
1003和1005缺少价格; - 订单
1003和1006缺少状态; - 客户名称大小写不一致;
- 一行空白行不应成为交易记录。
使用以下提示:
在修改此工作簿之前,先对其进行概要分析。返回源行数、完全重复分组、日期表示以及按列的缺失计数。然后创建一个新工作簿,移除完全重复的行,将日期标准化为 yyyy-mm-dd,统一客户名称大小写,并保留缺失值,除非明确批准一条规则。包含一个名为“更改”的工作表,列出源行、字段、旧值、新值和规则。将输出行数对账到源行数。
如果代理将缺失价格更改为零、删除仅共享订单 ID 但不同的行、在未声明区域设置的情况下转换歧义日期、或省略更改日志,则判定运行失败。然后运行相同提示两次,比较行数、映射、更改的单元格和控制合计。
只有在小型夹具通过后,才创建 5 MB、25 MB 和 50 MB 的变体。在本文中,这些大型文件的跨供应商结果仍保持未经测试。公布这一限制比编造 Copilot 与匡优数言响应时间表更值得信赖。
有用的 AI 代理不是声称能做所有事情的代理,而是能在你的电子表格流程中完成正确部分,且其边界能让你的团队信任的代理。
如果你想评估文件到报告类别,请在匡优数言电子表格助手工作流中对清理后的导出文件运行上述夹具和记分卡。将提示、输出、异常日志和审核者决策保存在一起,以便在周期进入生产环境之前对结果进行审计。







