一篇学术论文会不会在多年后成为重磅成果,能不能在它“走红”之前就提前看出来?康奈尔大学的研究人员认为可以,而答案就藏在最容易被忽视的指标里——下载量。 研究团队发布了两组新数据集,分别来自arXiv和GitHub。arXiv是科研人员上传未经同行评审论文的重要平台,而GitHub则是开发者存放和分享代码的地方。他们的目标是验证一种名为“领先-滞后预测”的方法,即利用早期关注度,比如浏览量、下载量和点赞数,来预判哪些论文或项目未来几年会产生较大影响。 为什么这个方法能成立?目前,评价一篇论文的重要性,主要看它被其他研究者引用了多少次。但问题在于,引用数据往往要等上好几年才会逐步显现。于是,团队不再等待引用数据,而是转而观察论文发布后,人们有多快开始阅读它。论文合著者Yian Yin认为,这就像一场“预测市场”,只不过科学家押注的不是金钱,而是他们的时间。 另一位资深作者Sarah Dean指出,如今每个平台其实都在收集这类互动数据,而这些数据最终被证明是未来影响力的强有力预测指标。 研究人员分析了arXiv上230万篇论文的匿名下载数据,并将早期下载量与五年后的引用次数进行对比。结果发现,仅凭一个月的下载数据,就能相当准确地预测一篇论文未来五年的受关注程度。 同样的预测逻辑也适用于代码吗?答案是肯定的。团队还分析了GitHub上近300万个代码仓库的推送、星标和分叉数据,发现了类似的模式:早期的星标和推送数量,往往能转化为五年后更多的项目二次开发。 研究者希望,这些公开数据集能帮助更多人构建更精准的预测工具。同时,也有声音提出,这种方法或许还能用来甄别那些大量涌入arXiv的低质量、由AI生成的论文,在它们进一步淹没平台之前及时发出预警。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.