来源:市场资讯
(来源:Pubpeer)
澳大利亚昆士兰科技大学的研究人员近日指出,谷歌旗下平台Kaggle上的部分临床数据集存在严重质量问题,甚至包含名人照片,却被用于训练中风和糖尿病的预测模型。这些“糟糕透顶”的数据集不仅通过了同行评审,还支撑起了124篇科学论文,部分模型甚至已进入临床实践评估阶段。
![]()
统计学家阿德里安·巴内特和博士生亚历山大·吉布森在预印本平台medRxiv上详细描述了他们的发现。其中一个名为“droopy”的数据集,本应用于早期中风检测,但其中混杂了史泰龙、克鲁尼等名人的多张重复照片,甚至还有儿童图片。巴内特直言:“这显然不适合严肃的科学研究,在伦理和科学上都是不恰当的。”
他们的调查追溯了Kaggle上两个关于中风和糖尿病的数据集流向,发现其催生了124篇论文。这些数据集未能通过基本的数据来源核查,存在大量重复记录且缺失值异常少,与真实临床数据特征严重不符。 这一问题已导致《科学报告》等期刊上多篇论文被撤回,因为作者无法提供数据来源或准确性的证明。
Kaggle发言人回应称,平台上的合成数据使用是合法的,但主要用于基准测试,不应作为医学研究的主要证据。 出版社方面则表示正在进行调查,并将采取适当行动。研究人员强调,在数据来源未明之前,相关在线工具和论文都应受到严格审视。吉布森总结道:“这很简单,你关心的是患者还是论文?”
https://retractionwatch.com/2026/05/18/kaggle-dataset-clinical-models-stroke-diabetes/
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.