简体
  • 简体中文
  • 繁体中文

热门资讯> 正文

三个最火 AI 办公产品的金融能力盲测

2026-09-14 16:34

(来源:佩妮Penny的世界)

大家好,我是penny。

最近看到一个 AI 办公产品的榜单,感受到了大厂在这个方向的疯狂卷法……

根据 Quest Mobile 的统计,AI效率办公赛道月活合计达到了1.02亿。

不知道它这个合计有没有去重,我实际的体感是,现在行业的渗透率和频次还是比较低的,头部的产品月活跃用户也就是在几百万量级。

我们假设中国办公工具的天花板是 WPS 的 5 亿月活,渗透率也就是在 1%~2%,100 个人中还只有1-2 个人开始使用这类产品,行业还处在非常早的阶段。

但是榜单归榜单,在金融类场景,月活和排名都不太管用,还是要实际使用体验说话。 

我之前的主力主要还是 Codex,现在国内产品这么多,也好奇国产到底能做到什么程度。所以本人突发奇想,对国内头部这几家做个金融类场景同一条件下的测试,这次测的榜单中头部的 3 家: workbuddy、百度搭子和千问办公。

(字节系整合的豆包工作还在测,下次再说好了。)

具体方式是,我设定了 3 个场景,给不同的 AI Agent 发完全一样的指令,评价的标准主要是金融数据的准确性、逻辑推理/分析能力。

评分也不是我打的,是把问答结果整合之后,抹去具体模型名称,发给 codex 让它打的,Prompt 和过程可追溯。

真正的 AI for AI,哈哈哈哈。

让我们先来公布一下结果:

排名

模型

综合分

一句话结论

1

B

89.0

财报数据能力强,主题选股分析逻辑清晰,但财年指引口径有失误。3 项综合得分稳定性强。

2

C

86.5

组合洞察能力强,整体能力均衡,但宏观事实核验仍需加强;

3

A

71.5

单股分析能力强,但问题1选错报告期,严重拖累总分;

大家可以先猜猜 ABC 是谁,结果应该会出乎你的意料。

(其实也出乎了我的意料。。。)

【着急的先拉到最后看答案,再回来看过程】

ps:这次多数使用的都是产品的默认配置,模拟普通用户使用习惯。比如说 workbuddy 使用的均衡模式GLM-5.3。千问和百度都是用自家模型。

为了考验每个 Agent 自行获取准确数据源的能力,我都是纯 prompt 提问,没有喂任何本地的报告或者数据,要求他以官方披露的文件为第一优先。

百度搭子和 WorkBuddy 都有已经内嵌的金融套件,提问时有选择使用,千问办公需要自定义金融类的使用习惯和场景,能看得出来,大家对金融这个场景都很重视~

问题 1——财报摘要/数据准确度核验。(35 分)

这次我选取了月初公布财报的博通,让 AI 查找并且核验最新一季的财报数据。美股可以考验他们直接在 SEC 拿官方数据的能力。(就不重复大段的 prompt 了,最后会有链接)

结果:

这里出现了本次测评的最大 bug。。。可怜的 A 同学因为审题不严,直接判断错了财报期,20 分直接扣光光。

虽然是一句话就能纠正,但是这种考试表现放在学校,是要被老师拎到办公室直接教育的程度。

B 和 C 都基本准确,属于吹毛求疵的扣点分,codex 老师还是太严格了。

问题 2——做个股的基本面、估值和持仓建议;(35 分)

这边是以科大讯飞为例,需要分析最近股价异动的原因,给出普通投资者能看懂的盘后诊断,而且是 html 的可视化展示。(刚好也可以比较多模态展示能力。)

这里我也要说一下,也不要指望 AI 能够给你预测股价,更重要的是它快速总结和获取信息的能力,以及在过程中体现出来的思路和逻辑是否清晰,环环相扣。

(客观分是事实的准确度,主观分是逻辑评判。也都是 AI 打的)

结果:

 这个是 B 产品的展示结果,在手机上的展示效果也很好,内容很全。

(hhhh 是我本人)

(hhhh 是我本人)

问题 3——基于当下的宏观环境,设定的资金规模和风险偏好,做 AI 领域的主题选股。(30 分)

假设现在你有100万美元,构建一个持有期为12个月的美股AI产业链组合,需要从给定的 10 只股票里选择。

这其实是一个组合构建题,没有什么标准答案。还是说看过程中有没有出什么纰漏。

首先是选股的结果:

哈哈哈,感觉 AB 稳如老狗。

另外,其实这次有让他们给出这 10 支里面最不建议买的股票,这个也挺有意思。

本题得分如下(B 最高):

好了,现在公布 ABC 分别是哪家:

A:腾讯 workbuddy

B:百度搭子

C:千问办公

从模型评测的结果上,百度搭子和千问办公最后的得分差距不大,百度高 2.5 分。体感问答速度上 workbuddy 比较快,百度搭子居中,千问速度最慢,而且经常跳出允许button。

百度搭子的亮点体现在稳定性。三道题分别拿到34、27.5和27.5分,没有出现报告期错误、任务中断或整题失效。三道题中的最低分也是三家里最高的。 

金融研究里,我会很看重这种稳定。偶尔拿一次满分当然很好,每次都先把财报期、数据口径和来源弄对,才敢继续往下分析。

而目前使用人数最多,有先发优势的 workbuddy,因为一开始误判财报季,惨遭 AI 辣手扣分,直接滑铁卢了。

从测验结果也可以看出,现在大模型领域其实大家也都是你追我赶,交替式领先上升。过程肯定不够严谨,不过有个感觉就是,未来如果模型的智能水平接近,能够决定市场占有率的,其实就是产品稳定性和细节体验了。

感觉上AI 办公类 Agent 产品,已经从比“谁的模型更聪明”,进入了“谁能拿到更多的上下文,进入真实工作场景”的比拼。

大家手上都有一些各自的牌,过去互联网大厂积累的很多老资产,到了Agent时代可能会被重新定价。

搜索、知识库、云、办公软件、企业系统、支付、硬件,看起来是完全不同的生意,现在都可以被拆成Agent的眼睛、记忆、手脚和工作现场。

而通用 Agent ,未来可能是 token 分发的入口,拥有下一阶段的平台级想象力。

最后,这是这次测评的一些过程展示哈:

【百度搭子】100 美金仓位分配:https://www.dumate.cn/s/lCLvuB4s

【百度搭子】100 美金仓位分配:https://www.dumate.cn/s/lCLvuB4s

【WorkBuddy】核验博通最新季度财报数据,https://workbuddy.link/p/If3DTyOD0X5RioA5XeJ5AR?ext2=copy_link(翻车现场……)

codex 测评的 prompt&过程:

整理这些答案搞得我头昏眼花,哎,欢迎大家留言,吐槽,讨论和交流

测这几家我甚至都没付费,每个都有一堆积分送……妥妥新手福利期,大家多去用起来~

我是佩妮,关注我,一个只说真话的创投人

风险及免责提示:以上内容仅代表作者的个人立场和观点,不代表华盛的任何立场,华盛亦无法证实上述内容的真实性、准确性和原创性。投资者在做出任何投资决定前,应结合自身情况,考虑投资产品的风险。必要时,请咨询专业投资顾问的意见。华盛不提供任何投资建议,对此亦不做任何承诺和保证。