上周GPT发布了Astra模型,我看不少博主都对它做了测评,看起来确实都很炫。
但是我在使用一段时间后,最大的感受就是,强是真的强,贵也是真的贵。
我就是用轻读思考模式,额度也分分钟就跑完了。
![]()
除非真的是每个月花200美刀开通20X,否则一般的任务真不敢给它跑。
在这种背景下,其实我也更想知道,作为非程序员,Astra模型对我们实际的工作和投资研究到底有多大帮助。
我是不是需要花巨大的代价和不方便程度来使用它。
这就是我这次测试的初衷。
在跑了两天、用完两次重置卡之后,我终于做完了这次的测试。
在我们的日常工作中有一大类基础活。
也就是从一堆固定资料里提取数据填表、算几个指标、核对一下口径。
这类工作对聪明程度的要求并不高,但对准确度和精确性的要求很高。
本次测试想回答两个问题:
1、这类基础工作,顶级模型和轻量模型的实际表现有没有差别?
2、给轻量模型一份文字版工作手册Skill(明确的执行方法),能不能让它达到和顶级模型相当的水平?
这次测试我用的模型分别是顶尖的Astra和轻量的DeepSeek-V4-Flash。
我设计了两个问题,分别是财报整理和批量取数。
另外,我还加了一个变量。
既然前面讲过Skill可以保存工作方法,那么给模型一份工作手册,能不能让轻量模型把事情做得更好。
所以,测试的时候针对每个模型都做了有无工作手册的测试。
在Codex的环境下,用GPT-6 Astra轻度思考和DeepSeek-V4-Flash中度思考来做了整个测试。
一共有8个(2✖️2✖️2)测试。
![]()
测试题目一
给六份上市公司年报(宁德、隆基、美的的2024和2025年报),PDF格式。 要求整理这三家公司2023—2025年的营收、归母净利润、总资产、总负债,以及 2024—2025 年的预收款项、合同负债。 结果需要换算成亿元并保留4位小数,再算营收复合年均增长率并排序。 纯固定资料处理,禁联网、禁 Wind。
工作手册
开始前建立任务字段清单,确认代码、日期、统计对象、单位和数据版本,并在后续查询中保持这些条件。 严格区分真实零值、未披露、未返回、无权限及不适用。无法确认的数字留空,并在单独状态列说明原因,不自行估算。 计算前统一口径和单位,核对公式与时间间隔;统计缺失值时说明有效样本数,不能用现成近似字段替代题目要求的计算。 保留来源位置和原始证据;核对关键值及异常值,勾稽或总数通过不等于字段含义正确。 交付前核对结果表、计算和文字结论是否一致,只有已验证的范围可以称为完整,不把样本写成全集。
上面的问题一共需要返还给我48个字段的结果,测试1-4的这48个结果全部都交付了。
核心结论,营收复合年均增长率排序上都是一致的。
美的集团10.77%,宁德时代2.80%,隆基绿能负26.30%。
在这个测试结果上,如果只看最后核心结论,那我的暴论就是,基础工作用Astra就是浪费钱。
但是核对细节正确性上,我发现确实还是有区别的,主要在严谨程度上不一样。
第一个问题发生在测试1,也就是用Flash且不给操作手册的情况下,模型返还的数据把空白写成了0。
宁德时代2024、2025年合并资产负债表的预收款项因为没有披露,所以这一栏是空白。
测试1把它填成了0.0000,备注按未发生0处理。
而题目有明确要求,空白≠零,这一栏只是没披露,不是没有。
正确做法是保留空值并说明未确认。
第二个问题发生在测试4,也就是用Flash,且给了它操作手册。
它漏掉了最新报告的重述数据。
隆基绿能在2025年报第13页明确披露了2023年的调整后归母净利润和总资产。
测试4主观判断2025年报无2023年度列,所以在查找2023年数据的时候,直接用了2024年年报的旧值。
这一点,我在题目的要求细则里之前也有过约定,要求优先采用最新报告明确披露的重述或调整后数据,测试4这一条没做到。
对比下来Astra组两个结果都没犯错。
测试2(Astra有手册)、测试3(Astra无手册)都正确把宁德、美的的预收款项空值留存,没有擅自写成0。
在隆基2024年年报调整数据后,它们都正确的采用了最新调整后的数据。
另外,这两次测试还额外识别并记录了隆基2023年总资产与负债口径疑点,调整说明与披露值无法互证,做了逐页数值核验和勾稽。
测试题目二
连接真实Wind接口,取2026年9月4日沪深300完整成分股名单,按代码升序取前 120 只。 再取这120只的总市值、PE TTM、PB LF,算三个指标的中位数。 真实工具使用,20分钟/20次Wind调用上限。
工作手册
开始前建立任务字段清单,确认代码、日期、统计对象、单位和数据版本,并在后续查询中保持这些条件。 严格区分真实零值、未披露、未返回、无权限及不适用。无法确认的数字留空,并在单独状态列说明原因,不自行估算。 计算前统一口径和单位,核对公式与时间间隔;统计缺失值时说明有效样本数,不能用现成近似字段替代题目要求的计算。 保留来源位置和原始证据;核对关键值及异常值,勾稽或总数通过不等于字段含义正确。 交付前核对结果表、计算和文字结论是否一致,只有已验证的范围可以称为完整,不把样本写成全集。
这次的核心结果后四组也完全一致(测试5-8)。
沪深300成分股名单、120只样本集合,四组完全一致。
PE TTM中位数22.76倍、PB LF中位数2.99倍,四组完全一致。
不过在细节上也是有差别的,在算总市值中位数的时候,Astra更严谨。
![]()
Astra发现Wind同时返回总市值1和总市值2两个字段。
它主动查了接口文档,确认总市值2含限售股,采用了它并逐行记录了下 31只两个口径不一致的股票。
Flash则直接用了总市值字段,结果表里承认返回列标题有时是总市值1、有时是总市值,未能判定是否排除限售股。
虽然题目只写了总市值,没写明限售股口径,但从严谨性看,Astra主动识别并处理了口径分歧,Flash没有察觉。
所以,最后根据结果的结论就是,在大的结论和方向判断上,以及模糊化取数的要求下,轻量级模型就够用了。
无论有无工作手册顶级模型Astra在细节严谨性上明显都要更有优势的,轻量模型Flash则容易留有一些小的坑。
另外,工作手册这块也是这次测试最意思的一点。
Astra不管有没有手册,表现几乎一样,正确、严谨,连空值不填0、采用重述数据这些细节都一致做对。
Flash有没有手册,都没能避免犯错。测试1把空值填 0,测试4漏掉重述数据,都是手册里明确写了的规矩。
手册既没帮上顶级模型Astra,也没能补上轻量模型Flash的短板。
这也让我对写好一份Skill,轻量模型就够用了这个想法,多了一点保留。
当然,这不等于Skill没用。
我注意到,Astra模型在有手册时把核验做得更彻底,它花了19次调用PB报告期核验成功、多核验了报告期/披露日期/指标定义。
无手册时则停在结果拿到了、报告期没查到就如实交差,只使用了12次调用的PB报告期。
这样可以减少纰漏。
![]()
这次只测了一份8条文字手册,没有测试带程序校验、字段映射和固定模板的完整流程,更不能由此推到所有垂直Agent。
跑完以后,回到最开始的问题,做这些基础工作,有没有必要用Astra?
我认为,对于普通人而言,与其纠结于模型,不如把更多精力放在如何使用模型和如何使用Agent上。
国产大模型即使是轻量版,都能够完成很多创意类的想法和大量的基础工作。
这也是我最近一个月使用WorkBuddy+DeepSeek最大的感受。
在基础工作这块,模型之间的差距更多体现在对规则的遵守和精确度上。
我们一般的工作,或者对于结果没有那么强精确度要求的活,使用轻量模型就够了,没必要想各种办法花大价钱用到最顶级模型。
特别是如果你只有一个初略的想法,想要通过AI来判断或者实现这个想法,那么国产模型完全够用了。
决定你结果的更多还是你的想法。
对于专业人士而言,或者对数据要求比较高的,还是建议用最顶级的模型,再加上一些更丰富的工作手册Skill。
我之前说过,大模型现在的问题就在于数据的精准性上有时候并不能让人完全放心和满意。
那么通过这次测试,我们至少知道通过什么办法来减少这种问题。
不过,这次测试也让我在思考Skill的意义。
这次的测试其实挺简单,但是即使在这种简单的测试里,轻量级模型都不能遵守工作手册。
那么Skill对模型的约束边界到底在哪里。
就优先级而言,我观察到的是,首先是模型本身,其次才是工作手册。
但工作手册在顶级模型面前又却有意义。
我想这也是现在很多垂直类Agent的价值,通过喂足够多的hnow-how,来实现结果的尽量客观精准。
至于这种价值最终是通过Skill和专家团接入通用Agent来实现,还是本身自身就有价值,这个就是仁者见仁智者见智的事了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.