沃顿商学院教授Ethan Mollick最近做了一次有趣的实验:让Astra AI去完成一项原创创业研究。他要求Astra自行寻找在线数据集,并预先注册研究假设,然后看它最终能产出什么。
结果有点出乎意料,又在意料之中。Astra确实交出了一堆格式漂亮、技术上挑不出毛病的论文——但选题全都无聊透顶。Mollick在社交平台上直言:“没有研究品味。”
![]()
技术满分,品味零分
![]()
这不是Astra第一次在“看起来很强”的任务上翻车。Mollick的测试设计其实很刁钻:让AI自己找数据、自己定假设、自己完成整个研究流程。这意味着AI拥有极大的自主权——它可以选择研究什么,也可以决定怎么研究。
结果Astra的选择暴露了它的本质:它擅长把一件事做得“正确”,但不擅长判断“什么事值得做”。它能在给定的框架内完美执行,却无法像人类研究者那样,凭直觉嗅出哪个问题真正重要、哪个方向能带来新洞见。
“合格”恰恰是最尴尬的评价
Mollick用了“beautifully formatted, technically correct”来形容Astra的产出——格式精美、技术正确。这两个词放在一起,对学术研究来说几乎是一种批评。论文不是填空题,不是格式对了、数据跑通了就算完成。真正的研究需要选题眼光,需要知道哪些问题值得追问,需要识别出那些“看起来不起眼但可能改变认知”的线索。
这正是当前AI的普遍短板。大模型在“执行”层面已经很强,但在“判断”层面依然薄弱。它们能写出语法正确的句子,却写不出有观点的文章;能跑出统计显著的结果,却选不出有意义的研究问题。
![]()
研究品味为什么难教?
品味这东西,本质上是一种长期积累的直觉。它来自读过的几百篇论文、做过的几十个失败实验、和同行无数次争论后形成的判断力。这种能力很难被编码成训练数据——它藏在那些“说不清为什么但就是觉得不对”的瞬间里。
Mollick的测试给了一个清晰的信号:AI做研究的下一个瓶颈不是技术能力,而是审美判断。当模型能轻松处理数据、格式、统计方法时,真正拉开差距的变成了选题、视角和洞察力——这些恰恰是当前AI最缺乏的。
对创业研究来说尤其如此。创业领域的问题往往模糊、复杂、充满情境依赖,一个“技术上正确但选题平庸”的研究,对实践几乎没有指导价值。Astra能产出合格论文,但离“有用”还有距离。
这次实验的价值在于,它把AI能力的边界画得更清楚了:执行层已经接近人类,判断层还差得远。下一步的突破,可能不取决于模型参数再翻几倍,而取决于能不能让AI学会“什么值得研究”这件事。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.