![]()
导语
面向大模型驱动科研自动化的发展趋势,探讨生成式人工智能在科研流程中的能力边界与方法价值。本期读书会为Vibe Modeling读书会第九期,中山大学物理与天文学院CIBR吉妮实验室实习生贾梓杏将聚焦于经典科研智能体论文,分析大模型在科研自动化中的应用路径与评价方法,并探讨如何在 Vibe Modeling 实践中提升模型结果的可靠性,以及人类研究者在智能化科研中的作用。
集智俱乐部联合同济大学长聘副教授陈小杨和北京林业大学副教授李周园共同发起,本读书会旨在跨越硬科技与社会科学两大板块,系统梳理Vibe Modeling的技术现状、应用潜力与开放问题,通过集体实践形成可复用的提示策略及评估方法,为这一新范式奠定早期社区基础,助力推动其在各领域的规范化应用与人才培养落地。
报告简介
本期将以介绍多篇顶会/顶刊论文的Journal Club形式,从前 8 期聚焦的具体建模应用转向方法论层面的系统反思。围绕大模型驱动科研自动化的可信性与能力边界,讲解从领域专用辅助建模到端到端全自动科研的演进路径,结合认知建模(GeCCo)与全流程自动化(The AI Scientist)等典型案例,介绍相关技术实现的 Pipeline、迭代优化机制与多维度评估体系。进而深入探讨 LLM 科研能力边界的实证研究,以及如何在具体任务评估模型的结果,如神经元激活视角(SAE)与领域专用 Benchmark(LLM-SRBench、SIMBENCH),并能从一些学界提供的方法中学会如何在我们Vibe Modeling的过程中如何评估并优化模型给我们的答案。最终基于 Human or AI in the Loop 的理论辨析与 生成模型对于人类Critical Thinking 实证研究,重新审视自动化时代人类研究者的核心价值、批判性角色。
分享大纲
大模型辅助科研的 Pipeline:从领域专用建模到端到端自动化
生成结果的评估:多维度能力边界与可信及可行性检验
人类的作用:自动化浪潮中的批判性角色再定位
核心概念
端到端自动化科研(End-to-End Automated Research)
以 The AI Scientist 为代表的系统,旨在将科研全流程——从 Idea 生成、文献检索、实验规划、代码实现、结果可视化、论文撰写到同行评审——交由智能体自主完成。
逆向工程(Reverse Engineering)
在评估 LLM 科研能力时,反向工程指模型从黑盒系统的输入-输出对中推断其内部机制(如程序、形式语言或数学方程)的过程。Princeton 的研究将其形式化为:给定观测集合 O={(xi,yi)} ,模型需输出对黑盒函数 f∗ 的假设。这是检验 LLM 是否具备「科学发现」能力的基础任务。
自动化评审(Automated Review)
The AI Scientist 中用于评估生成论文质量的子系统。它模拟顶级机器学习会议(如 NeurIPS)的评审流程,对论文的 Soundness、Presentation、Contribution 进行 1–10 评分,并输出优缺点与接收/拒绝建议。
人在回路(Human-in-the-Loop, HIL)与 AI 在回路(AI-in-the-Loop, AI2L)
两种人机协作范式的根本分野。HIL 系统中,AI 掌握决策主导权,人类作为「标注者」或「纠错者」提供反馈以优化模型;AI2L 系统则相反,人类掌握最终决策权与系统控制权,AI 仅作为辅助工具提供信息、建议或自动化子任务。在科研自动化语境下,Vibe Modeling 更接近 AI2L,而全自动论文生成则偏向 HIL,厘清这一区分对评估责任归属与系统设计至关重要。
批判性思维(Critical Thinking)
在生成式 AI 辅助的知识工作中,批判性思维不再仅指传统的问题解决,而是被重新操作化为:目标与查询构建(Goal & Query Formation)、响应检查(Inspect Response)与响应整合(Integrate Response)。知识工作者通过验证 AI 输出是否符合客观标准、交叉核对信息来源、调整风格与语境,来确保最终工作质量。
主讲人介绍
主讲人:贾梓杏,中山大学物理与天文学院CIBR吉妮实验室实习生,目前已直博至北京大学前沿交叉学科研究院生命科学联合中心。研究领域:类脑结构计算建模 、类脑启发人工智能。
参考文献
[1] Lu, C., Lu, C., Lange, R. T., Yamada, Y., Hu, S., Foerster, J., Ha, D., and Clune, J. The AI Scientist: Towards end-to-end automation of AI research. Nature, 2026. URL https://doi.org/10.1038/s41586-026-10265-5.
[2] Gottweis, J., Weng, W.-H., Daryin, A., Tu, T., Sirkovic, P., Myaskovsky, A., Glowaty, G., Weissenberger, F., Orlandi, A., Popovici, D., Palepu, A., Rong, K., Tanno, R., Saab, K., Zhang, F., Blum, J., Carroll, A., Kulkarni, K., Tomašev, N., Zverinski, D., Rendulic, I., Vedadi, E., Hasler, F., Rimanic, L., Boia, M., Budiselic, I., Feinstein, B., Bellaiche, M., Sheffer, T., Freyberg, J., Ratcliff, J., Bertolli, O., Chou, K., Hassidim, A., Gokturk, B., Vahdat, A., Guan, Y., Dhillon, V., Vaishnav, E. D., Lee, B., Costa, T. R. D., Penadés, J. R., Peltz, G., Matias, Y., Manyika, J., Hassabis, D., Xu, Y., Kohli, P., Pawlosky, A., Karthikesalingam, A., and Natarajan, V. Accelerating scientific discovery with Co-Scientist. Nature, 2026. URL https://doi.org/10.1038/s41586-026-10644-y.
[3] Rmus, M., Jagadish, A. K., Mathony, M., Ludwig, T., and Schulz, E. Generating computational cognitive models using large language models. In Advances in Neural Information Processing Systems (NeurIPS), 2025. URL https://arxiv.org/abs/2502.00879.
[4] Lee, H.-P., Sarkar, A., Tankelevitch, L., Drosos, I., Rintel, S., Banks, R., and Wilson, N. The impact of generative AI on critical thinking: Self-reported reductions in cognitive effort and confidence effects from a survey of knowledge workers. In CHI Conference on Human Factors in Computing Systems (CHI '25), 2025. URL https://doi.org/10.1145/3706598.3713778.
[5] Si, C., Yang, D., and Hashimoto, T. Can LLMs generate novel research ideas? A large-scale human study with 100+ NLP researchers. In International Conference on Learning Representations (ICLR), 2025. URL https://openreview.net/forum?id=M23dTGWCZy.
[6] Ghareeb, A. E., Chang, B., Mitchener, L., Yiu, A., Szostkiewicz, C. J., Shved, D., Gyimesi, G. J., Laurent, J. M., Wright, S. M., Razzak, M. T., White, A. D., Finnemann, S. C., Hinks, M. M., and Rodriques, S. G. A multi-agent system for automating scientific discovery. Nature, 2026. URL https://doi.org/10.1038/s41586-026-10652-y.
[7] Geng, J., Chen, H., Arumugam, D., and Griffiths, T. L. Are large language models reliable AI scientists? Assessing reverse-engineering of black-box systems. arXiv preprint arXiv:2505.17968, 2025. URL https://arxiv.org/abs/2505.17968.
时间信息
2026年7月19日(周日)下午14:00-16:00,腾讯会议线上进行,感兴趣的朋友扫码报名加入Vibe Modeling读书会后,可进入学员群进行交流。
报名读书会:「Vibe Modeling」
集智俱乐部联合同济大学长聘副教授陈小杨和北京林业大学副教授李周园共同发起,将在集体实践中探索 Vibe Modeling 在不同领域的通用模式与特殊需求,沉淀可复用的提示策略、评估方法与工作流,为这一范式搭建早期社区基础,助力 AI 赋能的跨学科研究与人才培养落地。
读书会自2026年5月17日起,每周日下午14:00-16:00线上开展,持续10周,包含主讲分享与讨论交流,并提供会后视频回放,诚邀相关领域研究者及跨学科兴趣者参与。
扫描海报中二维码报名参加读书会
![]()
报名方式:
第一步:微信扫码填写报名信息。
第二步:填写信息后,付费报名。如需用支付宝支付,请在PC端进入读书会页面报名支付:
第三步:添加运营助理微信,拉入对应主题的读书会社区(微信群)。
PS:为确保专业性和讨论的聚焦,本读书会谢绝脱离 Vibe Modeling 读书会主题及相关问题的交流讨论;如果出现讨论内容不符合要求、经提醒无效者,会被移除群聊并对未参与部分退费。
加入社区后可获得的资源
完整权限包括:线上问答、录播回看、资料共享、社群交流、信息同步、共创任务获取积分等。
![]()
特色退费与激励机制
我们提供以下两种途径,让您的投入获得实际回馈:
任务达标退费路径
认领并合格完成任意两期字幕任务,即可退还全额报名费,并额外获得集智专属周边奖励。
运营成长激励路径
合格完成一个字幕任务后,可申请成为运营助理。在读书会项目顺利结项后,将退还学费。表现优异者,还有机会获得额外的奖学金。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.