网易首页 > 网易号 > 正文 申请入驻

AI需要一张脸,数据科学需要一条曲线

0
分享至

半个世纪前,美国数学家赫尔曼·切尔诺夫把复杂的多维数据画成了一张人脸,即将多维变量映射为面部特征,比如用眼睛大小代表血压,嘴角弧度代表胆固醇,这样便实现了高维数据的可视化,人们可以更直观地理解数据所代表的意义。面对如今百万维度的数据,如何在极其复杂的空间中捕捉真实信号,并为性能日益强大却陷入“黑箱”的AI提供科学解释?有学者认为,答案又重新指向切尔诺夫脸所蕴含的几何思想——几何不仅意味着数据的可视化,也同样可能是需要被估计的信号本身。而实现这一跨越的方法,正是“流形拟合”。

撰文 | 姚志刚(新加坡国立大学)

万象纷纭,而理有其形。得其形者,乃得其真。几何非观象之器,实为万象之信。流形拟合于众数之中求其形,于噪声之外见其真。

2026年7月,美国数学家、统计学家赫尔曼·切尔诺夫(Herman Chernoff,1923—2026)[注释1]去世,享年103岁。在Harvard Data Science Review随后发表的一篇专栏中[1],创刊主编孟晓犁教授从参加切尔诺夫的葬礼写起,回顾了切尔诺夫半个多世纪前提出的数据可视化方法——切尔诺夫脸(Chernoff faces)。文章将切尔诺夫脸与同期出版的暑期特刊Shaping Data Science: A Geometric Perspective联系起来,并针对我为此撰写的导论文章[12],提出了一个颇有挑战意味的观点:人工智能应该更多地使用切尔诺夫脸,而数据科学应该更多地进行流形拟合(manifold fitting)。

[注释1]赫尔曼·切尔诺夫:美国知名数学家和统计学家,曾任教于斯坦福大学、麻省理工学院和哈佛大学等高校,在序贯分析、实验设计和大样本理论等领域作出了重要贡献——“切尔诺夫界”和“切尔诺夫脸”均以其姓氏来命名。

这两项观点,乍看之下似乎属于两个完全不同的时代。切尔诺夫脸是20世纪70年代的统计图形,流形拟合则是今天仍在发展的高维统计方法。但实际上,它们指向同一个问题:当数据越来越复杂时,我们究竟怎样才能看见其中真正的信号?

这里所说的“看见”,包含三个相互连接的步骤:把数据变为图(几何结构)的过程中,其中的几何结构本身可能就是信号;流形拟合负责从带有噪声的高维观测中估测这种信号;人工智能则应在估计出的几何信号的基础之上,进行可以解释的合理预测与推理。

众所周知,几何学早已有关于描述形状、曲率和局部结构的成熟语言,统计学和机器学习也已谈论“流形”(manifold)二十多年;但长期以来,人们更多关心的是如何借助流形的假设,进行降维和寻找低维表示,而较少把那个潜在的几何结构本身作为需要从数据中估计的信号。换言之,“数据具有几何结构”与“几何结构本身就是信号”之间,还有重要的一步。流形拟合正是走出关键性的这一步,更进一步的是,让 AI 在估计出的几何信号之上进行科学预测、推理和解释。(至于为什么这与通常所说的流形学习有所不同,后面会具体谈到。)

纵观过去的历史长河,把几何结构本身作为值得寻找的对象,并不是一个陌生的观念。过去半个世纪,丘成桐等几何学家的重要工作不断表明,几何可以超越传统的学科边界:从微分几何和偏微分方程,到广义相对论和数学物理,对隐藏几何结构的寻找一次又一次连接起原本看似不同的问题。

一个典型例子就是卡拉比–丘流形:它源于纯粹的几何问题,后来却成为弦理论紧致化中的核心几何结构,并进一步进入超对称黑洞、黑洞吸引子以及黑洞微观结构等基础物理问题的研究当中。于我而言,这种跨越数学与物理的传统,也构成了“几何即信号”这一想法的重要思想背景。如果几何能够揭示数学和物理世界中隐藏的规律,那么面对复杂数据,我们是否也可以把几何本身看成需要寻找、估计和理解的信号?这种视角也使我越来越相信,真正值得追问的问题往往先于学科边界而存在——统计学、几何和人工智能之间的界线,不应成为提出问题的限制。

一张脸如何承载高维数据

切尔诺夫脸究竟是什么呢?其实很容易理解。假设有两组医学数据,每一组都包含十几个变量,包括年龄、血压、胆固醇、血糖、心率,以及一些不那么熟悉的生物标志物。它们整齐地排列在表格中,每一行代表一个人,而每一列代表一个指标。

如果是非专业人士,大概很难直接从表中迅速判断哪些人是相似的,谁又是与众不同的。但换个角度思考,如果把每一行数据变成一张脸又会如何呢?譬如,我们可以让眼睛的大小代表血压,嘴角的弧度代表胆固醇,脸的宽度代表血糖,眉毛的倾斜程度代表心率……如此这般,原本抽象的一串数字,就变成了一张可以整体观察的面孔,好不生动!更有趣的点在于,有些脸看起来相似,有些脸则立即显得与众不同。

1973年,正在斯坦福大学任教的切尔诺夫在《美国统计学会会刊》发表了一篇只有八页的论文,标题为“用人脸以图形方式表示k维空间中的点”[2]。当时,交互式计算机图形尚未普及,多变量数据主要还是以表格和静态图形呈现。如何同时比较许多个体和多个变量,是统计学一直以来面对的一个现实难题。

切尔诺夫提出,可以把每一个高维观测变成一张脸:眼睛、眉毛、鼻子、嘴巴和脸形分别表示不同变量。许多张脸排列在一起,就像把一张数据表变成一群人。这样观察者不必逐列比较数字,也可能迅速发现其中的群体、变化和异常的个体。

这项设计借助了我们对人脸的敏锐感知。比较两张脸时,我们通常不必逐一测量眼睛的长度、鼻子的宽度和嘴角的角度,也能很快判断它们是否相似。我们既会注意五官各自的样子,也会感受到它们的比例和搭配所形成的整体面貌。切尔诺夫脸正是利用这一点,把多个变量转化为同一张脸上的不同特征,让我们通过观察面孔,直观地察觉一组数据与另一组数据之间的相似和差异。

切尔诺夫脸的价值不只在于“脸”

切尔诺夫脸当然不是一种完美的数据可视化方法。把哪个变量分配给嘴巴,哪个变量分配给鼻子,本身具有一定的任意性,且人对不同面部特征的敏感程度也不相同。我们日常往往更容易注意到眼睛和嘴角的变化,反而容易忽略鼻子宽度或耳朵大小的细微差别。面部表情还可能带来不必要的情绪判断,尽管这些情绪含义与原始数据毫无关系。因此,切尔诺夫脸未必比普通统计图形更准确,也不适合所有分析任务。但它包含了一个相当有趣的思想:高维数据可以被理解为一个整体形态。

它同时提醒我们,数据的表达方式会影响我们对数据的理解。数字的排列、变量之间的相对关系,以及多个特征共同形成的形态,都可能改变我们看到的模式。因此在这个意义上,“AI应该使用更多切尔诺夫脸”,并不是代表今天所有的AI系统都应该重新采用一种20世纪70年代的统计图形。它反映的是一种更广泛的原则:AI不仅应当能够处理高维信息,也应当考虑怎样把复杂信息重新组织成人可以感知、比较和质疑的形式。机器不仅需要给出答案,还需要让人有机会看见答案所依据的结构。

苍蝇为什么围成了一个甜甜圈?

现在假设有一张照片,桌上放着一个甜甜圈,许多苍蝇聚集在它的周围,一个昆虫识别算法找出了照片中每只苍蝇的位置。删除原始照片后,我们看到的只剩下一组二维坐标点,其特殊性在于,这些点并不是随机分布的,而是围成了一个圆环。



图1 基于文献 [1] 中的示例,由 AI 生成

如果只看坐标,我们可能会认为,这些数据具有一个近似圆环的低维几何结构。我们可以测量圆环的半径,估计它的中心,或者用一条封闭曲线概括苍蝇的位置。但如果重新看一眼原始照片,我们立即就会明白:苍蝇之所以围成一个圆环,是因为桌上放着一个甜甜圈。

从另一个角度看,甜甜圈的形状并不只是帮助我们展示苍蝇集中在哪里,它还传达了一个与问题本身有关的信息:为什么苍蝇会以这种方式聚集。

当然,这个例子中仅凭一个圆环形状并不能严格证明什么因果关系,几何结构不会自动取代科学实验和因果推断。但它可以提示我们,数据中可能存在一个尚未被直接观察的组织机制,并引导我们在合适的时机提出下一步问题。

我们能够直接看见甜甜圈,是因为这就是一张二维照片(来自现实的三维世界)。对于高维数据,我们却没有这样的感官能力。如果苍蝇的位置不是由两个坐标,而是由数千个变量描述;如果那个“甜甜圈”不是一个平面圆环,而是隐藏在高维空间中的弯曲结构,我们自然无法看清整幅图像。这个时候,我们就需要数学和统计学帮助我们恢复那只看不见的“甜甜圈”,这正是“几何是信号”的含义——几何不仅仅告诉我们数据点在哪里集中,还包括了流形的形状、弯曲、边界、分支以及不同部分之间的连接关系,都可能与产生数据的机制有关。

从直线、曲线到流形

流形一词来自19世纪的几何学。1854年,黎曼在著名的就职演讲中提出,可以不依赖人们熟悉的三维空间,研究具有任意维数和内在几何的空间。此后,流形逐渐成为现代几何学的基本对象。

一条弯曲的线可以看作一维流形。一张卷起来的纸存在于三维空间中,但纸张本身仍然是二维的。与之类似,一组看起来极其复杂的高维数据,也可能主要沿着少数几个方向变化。

传统统计学经常用一条直线概括变量之间的关系,例如主成分分析(principal component analysis,PCA)试图寻找一条直线或一个低维平面,解释高维数据中最主要的变化方向。显然,现实数据未必沿着直线变化。

1989年,Trevor Hastie和Werner Stuetzle提出主曲线(principal curve):让一条光滑曲线穿过高维数据云的中心,把主成分分析中的直线推广为由数据决定的非线性曲线[3]。这项工作说明,统计学中的“拟合”不必局限于直线和预先设定的函数形式,数据自身也可以提示一条弯曲的中心结构。

到21世纪初,Isomap[4]、局部线性嵌入(locally linear embedding,LLE)[5]等流形学习(manifold learning)方法相继出现,引发了关注,并且推动了一个影响深远的观念:高维数据可能依附在一个低维流形附近,分析这类数据的关键之一是寻找适当的低维表示。例如,一张图片可能包含上百万个像素,一个像素对应一个维度,因此这张图可以被看作百万维空间中的一个点;同一个物体在不同图片中的变化,可能主要来自旋转、平移、光照和观察角度等少数因素。因此,虽然像素空间维数极高,这些图片依附的内在结构却可能低得多。

流形学习的主要目标,是寻找描述这种结构的低维坐标或表示;流形拟合则进一步要求在原来的高维空间中恢复流形本身。

一种低维表示可以把两个群体分开,也可以生成一张漂亮的二维图,却不一定告诉我们原始流形位于哪里、怎样弯曲、局部切空间朝向何方、是否存在边界,以及估计结果距离真实结构究竟有多远。于是,沿着主曲线开启的另一条道路,统计学家开始追问:如果数据本身位于一个已知的弯曲空间中,能否在这个空间内部寻找概括主要变化的曲线?

2014年,我在瑞士洛桑联邦理工学院工作期间,与合作者提出了principal flow(主曲线流)[6]。它可以被理解为一条位于黎曼流形上的主曲线:从一个代表数据中心的位置出发,沿着局部变化最大的方向在流形上延伸。

回到新加坡后,这项工作又发展为principal sub-manifolds(主子流形)[7]。我与合作者把一维的principal flow推广为更高维的子流形:不再只用一条曲线概括数据,而是在流形内部寻找一个能够捕捉主要变化方向的低维几何对象。

从principal curve到principal flow,再到principal sub-manifolds,几何对象从欧氏空间中的曲线,发展为流形上的曲线和更高维子流形。不过,这些方法有一个共同前提:承载数据的流形及其几何是已知的。换言之,我们已经拥有一张几何地图,要做的是在地图上找出最能概括数据变化的曲线或子流形。

由此,我们也可以看到后来流形拟合所面对的核心挑战:如果这张地图本身不可见,潜在流形又未知,观测还受到噪声污染,此时我们能否从数据中把整个流形估计出来?

流形拟合:估计数据中的几何信号

假如一条弯曲的丝带悬浮在房间里,许多细小的雪花落在丝带附近。我们只能看到雪花,却看不到丝带本身。从统计学的角度看,丝带的形状就是需要估计的信号,散落在周围的雪花则同时包含信号与噪声。降维的目标,通常是找到一种方式,把这些雪花排列在一张平面图上,使相近的点尽量保持相近。

流形拟合的任务,是从这些带有噪声的观测中恢复潜在的几何结构。那条看不见的丝带究竟在哪里?它向哪个方向延伸?在哪里发生弯曲?它是否存在边界?每片雪花偏离丝带的程度究竟有多大?

这与回归分析有某种相似之处。回归分析是从散乱的数据点中拟合一条直线或曲线;流形拟合则试图在高维空间中拟合一条曲线、一个曲面,或者维数更高、形状更复杂的几何对象,从而得到流形在高维空间中的位置、局部切空间、弯曲程度、边界以及不同部分之间的连接关系。这些几何量都可能成为后续科学分析、预测和推理所使用的信号。

到2010年代,研究开始更系统地从“寻找低维表示”走向“重建潜在流形”。2018年,数学家查尔斯·费夫曼(Charles Fefferman)[注释2]及其合作者研究了这样一个问题[8]:如果高维数据来自一个低维光滑流形,同时受到少量高斯噪声污染,我们能否构造出一个在几何意义上接近真实结构的新流形?

[注释2]查尔斯·费夫曼:美国数学家,普林斯顿大学教授,因数学分析的工作于1978年获得菲尔兹奖。

这一变化十分关键,因为研究目标不再只是把数据投影到一张二维图上,而是要在原来的高维空间中恢复产生数据的几何对象,并且从数学上说明恢复结果与真实流形之间究竟相差多远。但在真实数据中,噪声往往不能被假设为严格限制在某个固定范围内。以常见的高斯噪声为例,绝大多数观测虽然集中在一定范围之内,但从概率模型上说,噪声仍然可能取到任意大的值,这就是所谓的无界噪声(unbounded noise)。

需要注意的是,这里所说的“无界”,并不意味着每一个观测都带有极大的误差,而是说不能事先为所有噪声规定一个绝不会超出的上限。2019年,我与合作者在arXiv公布了论文Manifold Fitting under Unbounded Noise,系统研究无界噪声条件下的流形拟合问题;该论文经过进一步发展,于2025年正式发表于《机器学习研究杂志》(Journal of Machine Learning Research)[9]。

无界噪声是一个需要攻坚的难题,许多已有方法直接在带有噪声的样本点上估计局部切空间。但是,当样本点已经偏离真实流形时,在这些点上得到的局部方向可能变得模糊,由此拼接出来的流形也会积累误差。这项工作的一个关键思想是,在原始噪声样本点上估计切空间的同时,设法在样本投影到潜在流形的位置附近估计局部切空间,再利用这些局部几何信息构造流形估计量。

这项工作在无界噪声条件下给出了高概率的理论收敛保证,并用豪斯多夫距离(Hausdorff distance)控制估计流形与真实流形之间的误差,同时研究了估计流形的光滑性。它使流形拟合从一个主要依赖理想化噪声条件的几何重建问题,进一步成为一个能够处理常见随机噪声模型的统计估计问题:流形是需要恢复的几何信号;噪声具有概率分布;估计结果不仅要形成一个流形,还必须带有可以量化的误差保证。

在这一基础上,我们与丘成桐合作的论文Manifold Fitting[10],提出了一种两步映射方法,在原始高维空间中直接构造平滑的流形估计量。这项工作的目标不仅是得到一个低维表示,还要保证最终得到的对象本身确实是一个光滑流形,并从理论上控制估计流形与真实流形之间的几何误差。

这一要求体现了几何与统计学在流形拟合中的不同关切:几何学关心恢复出来的对象是否真正具有流形结构,是否保持了维数、光滑性和局部方向;统计学则关心在有限样本和随机噪声下,这种结构能否被可靠估计,估计误差如何随着样本量和噪声强度变化。

而流形拟合正好位于两者的交界处——它既不能满足于一张看起来合理的低维图,也不能只给出一个抽象存在的几何对象。它需要从真实数据出发,构造一个可以计算的流形估计量,同时为这个估计量提供统计和几何保证。

随后,我们又与丘成桐合作,把神经网络引入流形拟合,利用循环生成对抗网络(CycleGAN)学习高维数据与低维表示之间的映射,再回到原始高维空间中重建潜在流形,论文发表于《美国国家科学院院刊》[11]。这项工作说明,人工智能与流形拟合并不是相互替代的,神经网络可以成为估计几何信号的计算工具。经过流形拟合得到的几何结构,又可以进而成为AI进一步进行分类、预测和推理的基础。

这里的关键在于算法最终恢复了什么,而不是是否使用神经网络。如果模型只产生一组难以解释的潜在坐标,我们仍然不知道它学到了怎样的形状;如果它能够恢复一个可以描述、检验并量化误差的流形,那么AI所学习的表示才有可能转化为明确的几何信号。由此,流形拟合的发展形成了一条逐渐清晰的路线:从寻找低维坐标,到重建潜在流形;从较理想的噪声假设,到处理无界随机噪声;再到利用两步映射和现代神经网络,构造兼具几何结构、统计保证与计算可行性的流形估计量

几何可能就是科学发现的对象

看到这里,或许有人会有疑问,为什么我们要如此费力去估计数据背后的形状?因为在许多科学问题中,几何本身就是我们希望寻找的科学信号。

以单细胞数据为例。一个细胞可以通过上万个基因的表达水平来描述,因此每个细胞都可以作为高维空间中的一个点。但细胞不会在这个空间中任意变化,它们受到细胞类型、发育阶段、疾病状态和生物调控机制的限制,可能集中在某些低维结构附近。如果细胞正经历连续的分化过程,那么它们可能就沿着某些轨迹变化,这些轨迹还可能出现分支,意味着细胞走向不同的命运;如果疾病改变了细胞状态,数据的局部形状、曲率或相对位置也可能发生变化。在这里,轨迹、分支和局部弯曲并不只是可视化效果,它们可能分别对应细胞状态的连续变化、不同的发育命运,或者疾病带来的异常变化。

在我与合作者发表于《美国国家科学院院刊》的单细胞研究中[13],我们提出了单细胞流形拟合分析框架scAMF,并在来自不同测序平台、物种和器官的25个公开单细胞RNA测序数据集上进行了比较。研究表明,流形拟合可以改善高维基因表达数据的空间分布,增强同类细胞之间的邻域一致性,从而提高细胞聚类效果和数据可视化的清晰度。

这类研究关心的不只是“把细胞分成几类”,还包括细胞状态怎样连续变化,不同群体怎样连接,罕见细胞出现在哪里,以及哪些细胞偏离了正常的几何结构。类似的问题也出现在医学数据中。比如一个病人未必因为某项指标极端异常而表现出风险,真正重要的可能是多个指标之间的组合关系发生了改变。单独看,每个数值似乎都处在正常范围;但是如果放在一起就会发现,这个人却可能偏离正常人群形成的整体结构。

在另一项研究中,我与合作者把流形拟合用于英国生物样本库212,853名参与者的251项核磁共振代谢生物标志物[14]。研究首先把这些指标划分为七个代谢类别,再分别拟合相应的低维流形;其中三个流形能够把人群区分为具有不同代谢特征和疾病风险的亚群,相关疾病涉及代谢紊乱、心血管疾病和自身免疫性疾病。

综上所述,这两项研究足以说明,高维生物医学数据中的科学信息存在于多个变量共同形成的几何结构中。这里的几何就是信号本身。流形拟合也不仅是一种画图方法,而是对这种信号进行估计。

先估计信号,再让AI进行预测和推理

进一步地,如果几何结构是信号,流形拟合负责估计这种信号,那么人工智能应当在其中扮演什么角色?

目前许多AI系统采用端到端的方式工作。模型直接接受高维原始数据,通过大量参数完成分类或预测。例如,输入一张图片,模型输出图片中的物体类别;输入一组医学指标,模型输出某种疾病风险。只要预测准确,这种方法就可能非常有效。但对于科学研究和医学决策来说,只有一个预测结果往往还不够。

作为严谨的科研人员,我们希望知道:这个结果建立在什么结构之上?哪些变化被模型认为是正常的,哪些变化构成异常?模型的判断能否对应到一个可以被科学家、医生或使用者正确且高效理解的对象?对于以科学发现而不只是预测准确率为目标的AI,一条更理想的路径是,首先从高维观测中估计几何信号,然后让AI在这些已经被估计和描述的信号之上进行预测与推理。

这意味着,AI除了接收原始像素、基因表达或生物标志物的信息,原则上,它还可以使用流形拟合得到的结构(信息),从而帮助预测,甚至解释预测。

理想情况下,一个医学AI系统不仅可以告诉我们某位病人的风险较高,还可以进一步说明:这位病人是否偏离了正常人群形成的流形,偏离主要发生在哪些生物指标共同决定的方向上,以及这种偏离接近哪一种疾病状态。

类似地,在单细胞研究中,AI不仅可以判断一个细胞属于哪一类,还可能根据估计出的细胞状态流形,判断这个细胞位于哪一条变化轨迹上、正在朝哪个方向发展,以及它是否代表一种罕见或过渡状态。

这时,AI的推理就不必完全隐藏在一个难以观察的潜在空间中,而可以建立在能够描述和检验的几何对象之上,由此形成一条相对完整与清晰的分析链条:高维观测 → 流形拟合 → 几何信号 → AI预测与推理 → 人可以理解的解释。

切尔诺夫脸所代表的思想,可以再次出现在这条链条的最后部分:机器不仅要利用几何结构作出判断,还要把判断所依据的结构转化成人可以整体感知、比较和质疑的形式。

可解释性必须建立在可靠的估计之上

当然,并不是所有高维数据都位于一个光滑、低维的流形附近。真实数据可能具有分支、交叉、尖点和边界;几个不同流形可能彼此相交;数据的内在维数也可能随着位置而改变。更复杂的情况下,一个数据集可能由多个性质不同的几何结构共同组成。当噪声太大、样本太少或采样极不均匀时,我们也未必能够可靠地恢复潜在流形。因此,“数据具有流形结构”不应成为一种不加检验的信念。

真正的统计问题是要客观去判断:什么样的几何模型适合这些数据?这种结构是否可以识别?需要多少样本才能恢复?噪声会造成多大影响?当真实结构包含分支、交叉或不同维数的部分时,现有理论又应当怎样扩展?

尤其重要的是,如果流形拟合没有可靠地估计出几何信号,那么建立在它之上的AI解释也可能是不可靠的。可解释性不能只来自一个听起来直观的几何故事。它必须建立在可以检验的信号估计之上。流形估计本身的不确定性,也应当传递到后续预测和推理之中。否则,我们只是用一个几何黑箱替换了原来的神经网络黑箱。因此,几何直觉需要统计推断的约束,AI推理也需要可靠的几何估计作为基础。

让机器发现的形状重新变得可见

如今,AI发展迅速,已经可以处理人类无法逐一阅读的数字、识别图片、分析基因等,甚至也可以生成并不存在的脸。然而,计算能力的增长并没有自动解决理解的问题。机器可以找到一种有效表示,却未必告诉我们它发现了什么形状。也就是说,它可以给出一个准确答案,却未必让人看见答案赖以成立的结构,这里有一个明显的缺失。

因此,让AI多拥有一些“切尔诺夫脸”,即是要求它思考如何把复杂表示和预测依据转化成人可以整体感知、比较和质疑的形式。让数据科学多进行一些“流形拟合”,也不是要求所有数据都服从同一个几何模型,而是提醒我们,数据背后的形状不是分析结束后的装饰,它可能就是需要估计的信号。

半个世纪前,切尔诺夫把数字变成了一张脸。今天,我们拥有了更强大的机器,却仍然面对几个最基础的问题:数据中真正的信号是什么?我们怎样估计它?机器又能否在这些估计出的信号之上,进行人可以理解的预测和推理?

答案或许可以始于一张脸,延伸为一条曲线:几何是信号,流形拟合估计信号,而真正可解释的AI,应当尽可能在这些估计出的信号之上进行预测与推理。

参考文献

[1] Meng, X.-L. (2026). “Of Shapes and Curves—Why AI Should Use More Chernoff Faces, and Data Science More Manifold Fitting.” Harvard Data Science Review, 8(3). https://hdsr.mitpress.mit.edu/pub/jbqroy8g

[2] Chernoff, H. (1973). “The Use of Faces to Represent Points in k-Dimensional Space Graphically.” Journal of the American Statistical Association, 68(342), 361–368.

[3] Hastie, T., & Stuetzle, W. (1989). “Principal Curves.” Journal of the American Statistical Association, 84(406), 502–516.

[4] Tenenbaum, J. B., de Silva, V., & Langford, J. C. (2000). “A Global Geometric Framework for Nonlinear Dimensionality Reduction.” Science, 290, 2319–2323.

[5] Roweis, S. T., & Saul, L. K. (2000). “Nonlinear Dimensionality Reduction by Locally Linear Embedding.” Science, 290, 2323–2326.

[6] Panaretos, V. M., Pham, T., & Yao, Z. (2014). “Principal Flows.” Journal of the American Statistical Association, 109(505), 424–436. https://doi.org/10.1080/01621459.2013.849199

[7] Yao, Z., Eltzner, B., & Pham, T. (2026). “Principal Sub-manifolds.” Statistica Sinica, 36(3), 1069-1089. https://doi.org/10.5705/ss.202021.0163

[8] Fefferman, C., Ivanov, S., Kurylev, Y., Lassas, M., & Narayanan, H. (2018). “Fitting a Putative Manifold to Noisy Data.” Proceedings of the 31st Conference on Learning Theory, 688–720. https://proceedings.mlr.press/v75/fefferman18a.html

[9] Yao, Z., & Xia, Y. (2025). “Manifold Fitting under Unbounded Noise.” Journal of Machine Learning Research, 26(45), 1–55. 预印本于2019年首次发表于arXiv(arXiv:1909.10228)。
https://www.jmlr.org/papers/v26/21-0039.html

[10] Yao, Z., Su, J., Li, B., & Yau, S.-T. (2023). “Manifold Fitting.” arXiv:2304.07680. https://arxiv.org/abs/2304.07680

[11] Yao, Z., Su, J., & Yau, S.-T. (2024). “Manifold Fitting with CycleGAN.” Proceedings of the National Academy of Sciences, 121(5), e2311436121. https://www.pnas.org/doi/10.1073/pnas.2311436121

[12] Yao, Z., & Zhang, J. (2026). “Shaping Data Science: Statistics and Geometry.” Harvard Data Science Review, 8(3), 2026. https://doi.org/10.1162/99608f92.63b65052

[13] Yao, Z., Li, B., Lu, Y., & Yau, S.-T. (2024). “Single-cell Analysis via Manifold Fitting: A Framework for RNA Clustering and Beyond.” Proceedings of the National Academy of Sciences, 121(37), e2400002121. https://doi.org/10.1073/pnas.2400002121

[14] Li, B., Su, J., Lin, R., Yau, S.-T., & Yao, Z. (2025). “Manifold Fitting Reveals Metabolomic Heterogeneity and Disease Associations in UK Biobank Populations.” Proceedings of the National Academy of Sciences, 122(22), e2500001122. https://doi.org/10.1073/pnas.2500001122

作者简介

姚志刚,新加坡国立大学统计与数据科学系副教授,并在数学系兼任教职,主要研究流形拟合、非欧几里得数据分析,以及统计学、几何与机器学习的交叉。现任Journal of the Royal Statistical Society: Series B和Harvard Data Science Review的副主编。



版权说明:欢迎个人转发,任何形式的媒体或机构未经授权,不得转载和摘编。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
利拉德时隔529天复出15分!开拓者力克残阵勇士 杨瀚森6+3

利拉德时隔529天复出15分!开拓者力克残阵勇士 杨瀚森6+3

醉卧浮生
2026-10-08 12:31:00
俄罗斯鼠疫为何全球震惊?就是数百年前致死2500万人的欧洲黑死病!

俄罗斯鼠疫为何全球震惊?就是数百年前致死2500万人的欧洲黑死病!

听心堂
2026-10-08 08:50:42
开拓者主帅:杨瀚森完成了他该做的事情,我对他表现非常满意

开拓者主帅:杨瀚森完成了他该做的事情,我对他表现非常满意

懂球帝
2026-10-08 13:26:11
卫健委已将左氧氟沙星列为重点监控药物!提醒:服用千万注意

卫健委已将左氧氟沙星列为重点监控药物!提醒:服用千万注意

健康科普365
2026-10-07 11:35:08
谈崩了!国庆商议婚事,彩礼从38.8万降到36.8万仍谈不拢,江西小伙发帖哭诉经过,引发热议

谈崩了!国庆商议婚事,彩礼从38.8万降到36.8万仍谈不拢,江西小伙发帖哭诉经过,引发热议

火山詩话
2026-10-08 06:32:51
开拓者123-118击败勇士!杨瀚森创惊喜,这一战看到4个事实

开拓者123-118击败勇士!杨瀚森创惊喜,这一战看到4个事实

篮球大视野
2026-10-08 12:58:05
大满贯爆大冷!女单8强赛对阵,国乒女单0-3出局,王曼昱肩负重任

大满贯爆大冷!女单8强赛对阵,国乒女单0-3出局,王曼昱肩负重任

江启
2026-10-08 06:56:19
俄罗斯鼠疫零号病人已死,二号疑似病患死亡事件被删,多国严控,美国大使馆敦促所有在俄罗斯的美国人立即离开,40多天前的鼠疫演练疑云

俄罗斯鼠疫零号病人已死,二号疑似病患死亡事件被删,多国严控,美国大使馆敦促所有在俄罗斯的美国人立即离开,40多天前的鼠疫演练疑云

村里的月光
2026-10-08 05:45:07
网红“小四爷”不是退网是落网!把8个粉丝卖进缅北,每卖一人收12万,已致1人死亡

网红“小四爷”不是退网是落网!把8个粉丝卖进缅北,每卖一人收12万,已致1人死亡

听心堂
2026-10-08 08:03:22
高通辟谣?没有购买华为韬定律逻辑折叠技术,不是费用净支出方

高通辟谣?没有购买华为韬定律逻辑折叠技术,不是费用净支出方

互联网.乱侃秀
2026-10-07 09:56:58
媒体报道了白俄女歌手被摘除活体器官,但更多的受害者是无声的。

媒体报道了白俄女歌手被摘除活体器官,但更多的受害者是无声的。

吴女士
2026-10-07 21:15:24
俄罗斯鼠疫信息被指不透明,免签国人员要小心了,鼠疫属于甲类传染病,新冠还是乙类传染病,比新冠要严重很多,肺鼠疫未治疗死亡100%

俄罗斯鼠疫信息被指不透明,免签国人员要小心了,鼠疫属于甲类传染病,新冠还是乙类传染病,比新冠要严重很多,肺鼠疫未治疗死亡100%

村里的月光
2026-10-07 15:16:19
女子国庆期间结婚无接亲、无婚车,婚礼当天8点起床化妆,10分钟结束仪式,当事人:至少省下了1万元,准备留给蜜月旅行

女子国庆期间结婚无接亲、无婚车,婚礼当天8点起床化妆,10分钟结束仪式,当事人:至少省下了1万元,准备留给蜜月旅行

都市快报橙柿互动
2026-10-08 00:14:53
宇树科技盘中走弱 再创上市以来新低

宇树科技盘中走弱 再创上市以来新低

证券时报
2026-10-08 11:26:12
随着早田希娜2-3,WTT中国大满贯女单8强已诞生1席:韩国选手在列

随着早田希娜2-3,WTT中国大满贯女单8强已诞生1席:韩国选手在列

侧身凌空斩
2026-10-08 12:03:39
A股第二高价股跌停,网友:20cm跌停,仓重的人今天连饭都吃不下

A股第二高价股跌停,网友:20cm跌停,仓重的人今天连饭都吃不下

东方豪侠
2026-10-08 11:56:24
全世界都知道中国人放假,高市终于想起:中国是日本"重要邻国"

全世界都知道中国人放假,高市终于想起:中国是日本"重要邻国"

云居历史
2026-10-08 00:23:22
寒露至,秋意浓,北京将迎降雨降温+大风,具体时间——

寒露至,秋意浓,北京将迎降雨降温+大风,具体时间——

BRTV新闻
2026-10-08 09:11:54
独家对话奕境曾清林:沾上华为就能躺赢?双方都拼尽全力才能成

独家对话奕境曾清林:沾上华为就能躺赢?双方都拼尽全力才能成

柳杨商业评论
2026-09-24 17:48:10
河南警嫂赵君杰为夫喊冤被抓,被告人、被害单位均要求异地审理

河南警嫂赵君杰为夫喊冤被抓,被告人、被害单位均要求异地审理

法治边角料
2026-10-08 08:55:42
2026-10-08 14:32:49
返朴 incentive-icons
返朴
科学新媒体“返朴”,科普中国子品牌,倡导“溯源守拙,问学求新”。
4414文章数 15954关注度
往期回顾 全部

科技要闻

微软新Surface来了,2599美元起

头条要闻

日本前外相岩屋毅访华回国后发声:日本没必要装成大国

头条要闻

日本前外相岩屋毅访华回国后发声:日本没必要装成大国

体育要闻

梅西社媒发文告别国家队 C罗点赞留言:致敬 拥抱

娱乐要闻

给吴奇隆点赞的同时,再看蔡康永事件

财经要闻

美联储会议纪要:年内或将再上调利率一次

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

房产
教育
游戏
数码
本地

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

教育要闻

教育部、财政部部署实施2026年银龄讲学计划

外媒批评永恒之塔2胸部自定义!被玩家狂喷600楼

数码要闻

Xreal Aura定价1279美元 谷歌Android XR新机抢先问世

本地新闻

转型再出发 奋勇打头阵

无障碍浏览 进入关怀版