热门资讯> 正文
2026-09-14 16:34
(来源:佩妮Penny的世界)
大家好,我是penny。
最近看到一个 AI 办公产品的榜单,感受到了大厂在这个方向的疯狂卷法……
根据 Quest Mobile 的统计,AI效率办公赛道月活合计达到了1.02亿。
不知道它这个合计有没有去重,我实际的体感是,现在行业的渗透率和频次还是比较低的,头部的产品月活跃用户也就是在几百万量级。
我们假设中国办公工具的天花板是 WPS 的 5 亿月活,渗透率也就是在 1%~2%,100 个人中还只有1-2 个人开始使用这类产品,行业还处在非常早的阶段。
但是榜单归榜单,在金融类场景,月活和排名都不太管用,还是要实际使用体验说话。
我之前的主力主要还是 Codex,现在国内产品这么多,也好奇国产到底能做到什么程度。所以本人突发奇想,对国内头部这几家做个金融类场景同一条件下的测试,这次测的榜单中头部的 3 家: workbuddy、百度搭子和千问办公。
(字节系整合的豆包工作还在测,下次再说好了。)
具体方式是,我设定了 3 个场景,给不同的 AI Agent 发完全一样的指令,评价的标准主要是金融数据的准确性、逻辑推理/分析能力。
评分也不是我打的,是把问答结果整合之后,抹去具体模型名称,发给 codex 让它打的,Prompt 和过程可追溯。
真正的 AI for AI,哈哈哈哈。
让我们先来公布一下结果:
排名 |
模型 |
综合分 |
一句话结论 |
|---|---|---|---|
1 |
B |
89.0 |
财报数据能力强,主题选股分析逻辑清晰,但财年指引口径有失误。3 项综合得分稳定性强。 |
2 |
C |
86.5 |
组合洞察能力强,整体能力均衡,但宏观事实核验仍需加强; |
3 |
A |
71.5 |
单股分析能力强,但问题1选错报告期,严重拖累总分; |
大家可以先猜猜 ABC 是谁,结果应该会出乎你的意料。
(其实也出乎了我的意料。。。)
【着急的先拉到最后看答案,再回来看过程】
ps:这次多数使用的都是产品的默认配置,模拟普通用户使用习惯。比如说 workbuddy 使用的均衡模式GLM-5.3。千问和百度都是用自家模型。
为了考验每个 Agent 自行获取准确数据源的能力,我都是纯 prompt 提问,没有喂任何本地的报告或者数据,要求他以官方披露的文件为第一优先。
百度搭子和 WorkBuddy 都有已经内嵌的金融套件,提问时有选择使用,千问办公需要自定义金融类的使用习惯和场景,能看得出来,大家对金融这个场景都很重视~
问题 1——财报摘要/数据准确度核验。(35 分)
这次我选取了月初公布财报的博通,让 AI 查找并且核验最新一季的财报数据。美股可以考验他们直接在 SEC 拿官方数据的能力。(就不重复大段的 prompt 了,最后会有链接)
结果:
这里出现了本次测评的最大 bug。。。可怜的 A 同学因为审题不严,直接判断错了财报期,20 分直接扣光光。
虽然是一句话就能纠正,但是这种考试表现放在学校,是要被老师拎到办公室直接教育的程度。
B 和 C 都基本准确,属于吹毛求疵的扣点分,codex 老师还是太严格了。
问题 2——做个股的基本面、估值和持仓建议;(35 分)
这边是以科大讯飞为例,需要分析最近股价异动的原因,给出普通投资者能看懂的盘后诊断,而且是 html 的可视化展示。(刚好也可以比较多模态展示能力。)
这里我也要说一下,也不要指望 AI 能够给你预测股价,更重要的是它快速总结和获取信息的能力,以及在过程中体现出来的思路和逻辑是否清晰,环环相扣。
(客观分是事实的准确度,主观分是逻辑评判。也都是 AI 打的)
结果:
这个是 B 产品的展示结果,在手机上的展示效果也很好,内容很全。
问题 3——基于当下的宏观环境,设定的资金规模和风险偏好,做 AI 领域的主题选股。(30 分)
假设现在你有100万美元,构建一个持有期为12个月的美股AI产业链组合,需要从给定的 10 只股票里选择。
这其实是一个组合构建题,没有什么标准答案。还是说看过程中有没有出什么纰漏。
首先是选股的结果:
哈哈哈,感觉 AB 稳如老狗。
另外,其实这次有让他们给出这 10 支里面最不建议买的股票,这个也挺有意思。
本题得分如下(B 最高):
好了,现在公布 ABC 分别是哪家:
A:腾讯 workbuddy
B:百度搭子
C:千问办公
从模型评测的结果上,百度搭子和千问办公最后的得分差距不大,百度高 2.5 分。体感问答速度上 workbuddy 比较快,百度搭子居中,千问速度最慢,而且经常跳出允许button。
百度搭子的亮点体现在稳定性。三道题分别拿到34、27.5和27.5分,没有出现报告期错误、任务中断或整题失效。三道题中的最低分也是三家里最高的。
金融研究里,我会很看重这种稳定。偶尔拿一次满分当然很好,每次都先把财报期、数据口径和来源弄对,才敢继续往下分析。
而目前使用人数最多,有先发优势的 workbuddy,因为一开始误判财报季,惨遭 AI 辣手扣分,直接滑铁卢了。
从测验结果也可以看出,现在大模型领域其实大家也都是你追我赶,交替式领先上升。过程肯定不够严谨,不过有个感觉就是,未来如果模型的智能水平接近,能够决定市场占有率的,其实就是产品稳定性和细节体验了。
感觉上AI 办公类 Agent 产品,已经从比“谁的模型更聪明”,进入了“谁能拿到更多的上下文,进入真实工作场景”的比拼。
大家手上都有一些各自的牌,过去互联网大厂积累的很多老资产,到了Agent时代可能会被重新定价。
搜索、知识库、云、办公软件、企业系统、支付、硬件,看起来是完全不同的生意,现在都可以被拆成Agent的眼睛、记忆、手脚和工作现场。
而通用 Agent ,未来可能是 token 分发的入口,拥有下一阶段的平台级想象力。
最后,这是这次测评的一些过程展示哈:
【WorkBuddy】核验博通最新季度财报数据,https://workbuddy.link/p/If3DTyOD0X5RioA5XeJ5AR?ext2=copy_link(翻车现场……)
codex 测评的 prompt&过程:
测这几家我甚至都没付费,每个都有一堆积分送……妥妥新手福利期,大家多去用起来~
我是佩妮,关注我,一个只说真话的创投人