网易首页 > 网易号 > 正文 申请入驻

一个模型,既能看懂世界的形状,也能看懂世界的意思

0
分享至


你有没有想过一个问题:一个AI要"看懂"一张照片里的3D空间,到底需要几个大脑?

如果你去问工业界的工程师,他们大概率会给你掰着手指数出好几个模块。一个专门算深度的网络,输出每个像素离镜头有多远。一个专门算相机姿态的网络,告诉你这张照片是从哪个角度拍的。一个专门做点云重建的网络,把二维照片变成三维骨架。还有一个专门做光流的网络,追踪画面里哪些像素跑到了哪里。最后,如果你还想让AI回答"沙发左边是什么"这种问题,那还得再接一个语言模型。

五套系统,五套参数,谁也不认识谁。

这就是2026年之前,做"空间智能"这件事的普遍现实。而这篇来自浙江大学和商汤研究院的论文,提出的SPARGen,想干的事情很直接:把这五个脑子塞进一个脑子里,还得让它们真正共享知识,而不是简单地拼在一起假装团结。

问题到底难在哪

先说清楚现状。

在SPARGen出现之前,做3D重建和几何感知最强的模型之一是VGGT(Visual Geometry Grounded Transformer)。

> VGGT*:一个能同时预测相机姿态、深度图、点云和轨迹的前馈式几何重建模型,在多个3D重建基准上表现优异,但它不会说话,你没法问它问题。

VGGT在深度估计上,NYU-v2数据集的AbsRel(平均相对误差,越低越好)能做到0.065,δ1准确率高达93.8%。这是相当能打的数字。但它有一个致命限制:你没法直接问它"沙发右边是什么",因为它压根不理解语言,只会吐出数字矩阵。

另一边,语言模型阵营里最接近的对手是G?VLM,一个2026年发表的、试图统一几何预测和语言理解的模型。

> G?VLM*:通过引入专门的几何专家模块和语义专家模块,让一个多模态模型同时具备3D重建和空间问答能力的先前工作,是SPARGen最直接的竞争对手。

问题是,G?VLM为了做到"既懂几何又懂语言",硬生生塞进去了额外的几何编码器和回归头,本质上还是"模块拼接"的思路,只是拼得更巧妙。在论文的对比实验中,G?VLM在MindCube空间推理基准上的平均得分只有28.48分,而SPARGen做到了76.04分,差了47.56分,几乎是三倍的差距。

这就是这篇论文想解决的根本矛盾:几何感知需要精确的数值输出,语言推理需要灵活的符号生成,这两种"表达方式"天生就不兼容,硬拼在一起要么牺牲精度,要么牺牲灵活性。

如果打个比方,这就像让一个人同时用毛笔写书法、又用游标卡尺量零件精度。两种工具、两种思维方式,你不能指望随便焊接一下就能两头兼顾。之前的做法基本都是"焊接式"的:一个模块负责毛笔,一个模块负责卡尺,中间靠一根线连着传信息。SPARGen想干的是重新设计一双手,让它既能握毛笔,也能握卡尺,用的是同一套神经和肌肉。

核心思路:把一切都变成"生成"

SPARGen的底层逻辑其实相当优雅,可以用一句话概括:不管你要的是深度图、点云、光流,还是一句话回答,通通把它们当成"生成任务"来做。

具体怎么做到的?论文把所有的输出目标分成了两大类。

第一类叫"序列输出"(token sequence),也就是那些本质上是离散符号或结构化数值的东西,比如文字答案、相机姿态的四元数。这类东西用SPARGen里的"自回归"通道来生成,说白了就是像GPT那样一个字一个字往外蹦。

第二类叫"密集场输出"(dense field),也就是深度图、点云、光流这类和图像尺寸对齐、每个像素都有一个数值的东西。这类东西被编码成"图像"的形式,通过VAE(变分自编码器)压缩到一个潜在空间,再用"整流流"(rectified flow)技术像生成图片一样把它们生成出来。

> VAE*:一种能把图像压缩成一串数字(潜在向量),又能从这串数字还原回图像的神经网络模块。

> 整流流(Rectified Flow)*:一种生成模型的训练方式,核心思路是让噪声沿着一条直线路径逐渐变成目标数据,训练过程比传统扩散模型更简洁高效。

这个设计的精妙之处在于,它没有为深度图专门造一个"深度头",没有为点云专门造一个"点云头",而是把深度图、点云、光流全都伪装成了"图片",喂给模型本来就有的图像生成能力去处理。这个模型的底子是Bagel,一个此前已经具备强大图文生成能力的统一多模态模型。

> Bagel*:一个由字节跳动团队提出的统一多模态预训练模型,能同时处理图文理解和图像生成,采用MoT(Mixture-of-Transformer-Experts)架构。

这就带出了SPARGen架构的核心,MoT,也就是混合专家Transformer。

> MoT(Mixture-of-Transformer-Experts)*:一种架构设计,让"理解专家"和"生成专家"两条通路共享注意力机制,但各自拥有独立的前馈网络,既能交流信息又保持各自的专长。

具体来说,理解通路和生成通路各自有自己的模态特定投影层和前馈网络,但它们通过"联合多模态自注意力"机制互相看得见对方在算什么。这意味着当模型在学深度估计的时候,产生的几何信息会通过注意力层渗透给正在学语言推理的那部分参数,反过来也一样。

这里可以做一个类比,但要类比得准确一点。想象一所学校里,理科班和文科班上课时分开教室、用不同的教材,但他们共用同一个自习室,中间没有隔断墙。理科班同学在自习室里讨论几何证明的思路时,文科班的同学耳朵是竖着的,能听见推理过程里"因为A所以B"的逻辑链条,久而久之,文科班同学做阅读理解时也学会了更严谨的因果链条思维。如果这两个班从一开始就被安排在两栋楼里上课、放学各回各家,那么理科的严谨性永远渗透不到文科生的脑子里。这就是共享注意力层带来的知识迁移,而不是简单地把两个模型的输出结果拼在同一个表格里。

如果不这样设计会怎样?论文的消融实验直接给出了答案。当研究者把几何监督信号从训练中拿掉之后,光流估计的EPE误差从4.09恶化到4.29,SPAR空间推理基准的平均分从66.60掉到62.41,掉了4.19分。这说明几何知识确实通过共享的注意力层"渗透"给了语言推理能力,不是空谈。

具体怎么把深度、点云、光流"翻译"成图片

光说"把几何数据当图片处理"还是太抽象,我们看看论文里具体怎么做的翻译工作。

深度图的处理相对直接。给定一张深度图,模型会把每个像素的深度值归一化到0到1之间,公式是用当前图像里的最小深度和最大深度做区间缩放,离镜头近的地方数值趋近于1,远的地方趋近于0,然后把这个单通道的相对深度复制成三个通道,凑成一张"假彩色图"塞进VAE里。

点云的处理要复杂一些,因为点云涉及多视角的一致性问题。论文的做法是把所有视角下的点云统一放进一个以第一台相机为原点的坐标系里,然后计算一个整个序列共享的中心点和缩放尺度,用这个统一的中心和尺度去归一化每一帧的点云。这一步非常关键:如果每一帧各算各的归一化参数,那么不同视角之间的相对几何关系就全乱了,你会得到一堆各自"正确"但互相对不上的局部点云碎片,而不是一个连贯的3D场景。

光流的处理则用了一个"符号平方根变换",把水平和垂直方向的像素位移先按图像宽高归一化,再做一次带符号的开方操作。这个操作的目的是让数值分布更均匀,因为原始的光流位移值往往集中在很小的范围内,直接塞进VAE可能会因为数值太小而丢失精度。

这里论文还加了一个很实用的推理阶段技巧,叫"预测-变形-预测"的光流精炼流程。具体来说,模型先给出一个初步的光流估计,然后用这个估计把第二帧图像"扭曲"对齐到第一帧的坐标系下,再让模型对着这个扭曲后的图像去预测一个残差光流,最后把两次预测的结果加起来作为最终答案。

这个操作可以类比成你第一次给朋友指路说"往前走200米左转",结果朋友走到发现路口不对,于是你根据他现在站的位置再给一次修正指令"往回走50米"。第一次的粗略估计加上第二次的精细修正,比一次性说准更靠谱,尤其是在光流这种误差容易累积的任务里。论文的实验数据也证实了这一点:在KITTI数据集上,没有这个精炼步骤的SPARGen,EPE误差是5.26,加上精炼之后降到4.09,F1-all误差从21.82降到13.34,几乎降低了40%。

相机姿态:当数值也需要被"说"出来

相机姿态是个有意思的中间地带。它既不像深度图那样是密集的像素级数据,也不像文字答案那样是纯粹的语言。它是几个精确的数字:旋转和平移。

SPARGen的处理方式是把旋转矩阵转换成四元数(一种用四个数字表示三维旋转的数学工具),把平移向量拆解成方向和大小两部分,然后把这些数值统统量化到千分之一的精度,映射成模型词表里专门的数字token,按固定顺序拼成一句"话"生成出来。

这意味着相机姿态在SPARGen眼里,本质上跟"这个沙发是棕色的"这句话没有区别,都是一串需要按顺序生成的符号。这个设计选择说明了论文的一个核心理念:只要一个东西能被"说"出来,就没必要单独造一个数值回归模块去预测它。

在CO3D v2基准上,这个做法的效果是相对旋转准确率(RRA@30)达到96.84%,相对平移准确率(RTA@30)达到94.33%,虽然比专门做几何的VGGT(98.79%和96.89%)略低,但相比同为统一模型的G?VLM(96.69%和92.22%)已经有明显优势,而且远超其他统一模型能达到的水平。

训练目标:两套损失函数各管一段

既然输出分成了序列和密集场两种,训练时用的损失函数自然也得分成两套。

序列生成用的是标准的交叉熵损失,也就是让模型在预测每一个token时都尽量贴近真实答案,只在真正的目标token位置上计算损失,公式上就是对每个位置的负对数似然求平均。

密集场生成用的是整流流匹配损失,核心思路是训练一个"速度场"网络,让它能准确预测从噪声到目标数据这条直线路径上的运动方向。具体训练时,先用冻结的VAE编码器把目标(比如深度图)编码成一个干净的潜在向量,然后按照0到1之间的一个随机时刻,把这个干净向量和高斯噪声线性插值,混合出一个"半噪声"状态,模型的任务就是学会预测"噪声减去干净向量"这个目标速度。

每个训练样本只会激活它对应任务的损失函数,序列任务的损失前面还乘了一个权重系数λ,论文里设为0.25,用来平衡两种损失量级上的差异,最后把所有样本的损失求期望,就是整个模型的训练目标。

这个设计的好处在于,模型不需要区分"这是几何任务的参数"还是"这是语言任务的参数",所有参数在同一个反向传播过程里被两种不同性质的梯度信号共同塑造。这就像一个乐队里,鼓手和贝斯手虽然打的节奏型完全不同,但他们都要根据同一首歌的节拍器对齐,节拍器不会区分"这是鼓的拍子"还是"这是贝斯的拍子",它只负责让整体保持同步。如果两种乐器各自练各自的、互不校音,最后合奏出来的东西大概率是乱的。

数据说话:SPARGen到底表现如何

论文在三大类任务上做了详尽的对比测试,我们逐一看。

**视觉几何任务**

| 模型 | Sintel深度AbsRel↓ | NYU-v2深度δ1↑ | 7Scenes重建Acc.↓ | ETH3D重建Acc.↓ | CO3Dv2 RRA@30↑ |

| DUSt3R | 0.362 | 0.833 | 0.026 | 0.360 | 98.34 |

| VGGT | **0.265** | **0.938** | **0.022** | 0.311 | **98.79** |

| G?VLM | 0.257 | 0.935 | 0.062 | 0.539 | 96.69 |

| **SPARGen** | **0.235** | 0.935 | 0.034 | 0.393 | 96.84 |

在深度估计上,SPARGen在Sintel数据集上的AbsRel做到了0.235,是所有对比模型里最低的,甚至超过了专门做几何的VGGT(0.265)。这多少有点意外,因为SPARGen毕竟是个要兼顾语言能力的"多面手",能在专精任务上反超专家模型,说明几何和语言的联合训练确实带来了正向收益,而不是相互拖累。

**空间推理任务**

| 模型类别 | MindCube均分 | OmniSpatial均分 | OST均分 | SPAR均分 |

| GPT-4o | 41.52 | 42.39 | 39.25 | 37.88 |

| Qwen2.5-VL-72B | 41.71 | **52.03** | 37.37 | 39.34 |

| Spatial-MLLM-7B | 66.19 | 45.30 | 36.08 | 33.92 |

| G?VLM-2B | 28.48 | 42.62 | 23.24 | 38.73 |

| **SPARGen-7B** | **76.04** | 54.00 | **43.98** | **66.60** |

这张表格才是真正让人印象深刻的地方。SPARGen在四个空间推理基准上全部拿到最高均分,在15个细分类别里拿了13个第一。尤其是在SPAR-Bench上,它把第二名甩开了24.71分,这个差距相当悬殊。要知道,Qwen2.5-VL-72B是一个720亿参数的大模型,SPARGen只有70亿参数,规模差了十倍,但空间推理能力反而更强。这说明单纯堆参数量,解决不了空间理解这件事,真正管用的是把几何监督信号直接注入训练过程。

**光流估计任务(KITTI零样本迁移)**

| 模型 | EPE↓ | F1-all↓ |

| RAFT | 5.03 | 17.45 |

| GMFlow | 7.77 | 23.40 |

| FlowFormer | 4.10 | 14.51 |

| **SPARGen** | **4.09** | **13.34** |

在光流任务上,SPARGen甚至超过了专门做光流的FlowFormer,而且这是在完全没有针对KITTI数据集做微调的情况下(零样本迁移)取得的结果。这进一步证明了论文的核心假设:把不同任务塞进同一个生成式框架里训练,能产生真实的知识迁移效果,而不只是理论上说得通。

消融实验:拆掉一根柱子,房子会怎样歪

论文做了三组对照实验,每次拿掉一种监督信号,看看剩下的能力会受到什么影响。

拿掉几何监督之后,光流的EPE从4.09恶化到4.29,SPAR空间推理均分从66.60跌到62.41。这说明3D几何知识确实能给光流估计和语言推理都提供有用的结构信息。

拿掉光流监督之后,7Scenes重建的完整度误差从0.028恶化到0.038,SPAR均分从66.60跌到65.92。这说明学习稠密对应关系这件事,反过来也能帮助多视角重建的一致性,以及空间推理的准确度。

拿掉空间推理监督之后,情况有点微妙。7Scenes的重建精度误差从0.034轻微恶化到0.037,说明高层语义监督对几何表征学习也有一定的正向作用。但奇怪的是,光流性能反而略微变好了(EPE从4.09降到4.06)。论文对此的解释是,多任务学习里存在一种轻微的"容量竞争":语义推理虽然对静态3D结构有帮助,但自回归的token生成过程会和密集场预测争夺同一个MoT骨干网络的表达能力,两者不是完全无冲突的。

这个发现挺诚实的,论文没有粉饰太平说"所有任务加在一起永远是正向的",而是承认了多任务学习里存在真实的资源博弈。这种博弈就像一个人同时准备两场考试,复习历史确实能让你的作文写得更有逻辑,但复习历史占用的时间,多少会挤占你原本用来刷数学题的时间。收益和代价是同时存在的,只是在SPARGen这个案例里,收益明显大于代价。

这篇论文站在谁的肩膀上,又被谁接着往前推

在SPARGen之前,几何重建这条线上最有代表性的工作是DUSt3R,它把无标定的立体重建问题转化成点云图的回归任务,开创了"端到端预测点云"这个思路。紧接着VGGT把这个思路扩展到能同时预测相机姿态、深度、点云和轨迹,成为了这个方向上事实上的标杆模型。2026年,VGGT-Ω进一步把这套范式扩展到了更大规模的模型和数据集,并且加入了对动态场景的支持。

在语言推理这条线上,SpatialVLM通过构建大规模空间问答数据训练视觉语言模型来补齐空间推理短板,SpatialRGPT则把区域级监督和一个可插拔的深度表示结合起来。更进一步的VLM-3R从一个几何编码器里提取隐式的空间和相机token,塞给视觉语言模型做单目视频推理。

而与SPARGen关系最紧密的对照对象是G?VLM,这是2026年发表的另一个尝试统一几何预测和语言理解的工作,它采用了专门的几何专家和语义专家配合共享注意力的架构。SPARGen和它的根本区别在于:G?VLM还是引入了额外的几何专用组件,而SPARGen坚持只用预训练模型本来就有的图像生成通路和自回归通路去表达一切几何目标,不额外造轮子。

写在后面

读完这篇论文,最让我意外的一点,是SPARGen在深度估计上居然反超了专精的VGGT。这打破了我一个下意识的假设:多任务模型通常会在单项任务上有所妥协,专家模型总归应该更强。但这里的实验数据说明,当几何、对应关系、语言推理这三种监督信号真正共享同一套注意力层时,它们互相喂养出的表征质量,可能比单独训练某一项任务学到的表征还要扎实。

另一个值得琢磨的细节,是论文自己坦诚承认的那个"容量竞争"现象:拿掉语言推理监督之后,光流反而略微变好了。大部分论文写到消融实验,都倾向于把每一项加入的模块包装成纯粹的正面贡献,但这篇论文老实说了"这里有代价"。这种诚实其实挺难得的,也提醒我们多任务学习从来不是免费的午餐,每一次任务叠加背后都有资源分配的博弈,只是有没有算清楚这笔账。

论文也坦率提到了一个限制:VAE的空间压缩天然会给几何边缘和高精度物理量带来瓶颈。这意味着SPARGen目前更擅长恢复场景的相对结构和大致布局,但要做到亚毫米级别的精密测量,这条路径可能还有很长的距离要走。这个瓶颈会不会通过更高分辨率的VAE或者别的编码方式突破,是个值得持续关注的问题。

Q&A

Q1:SPARGen是什么,它解决了什么问题?

A:SPARGen是浙江大学和商汤研究院提出的统一多模态框架,它把3D重建、光流估计、相机姿态预测和空间问答这些原本需要不同专用模型的任务,全部统一到一个模型里,通过"生成"的方式完成,不需要额外的几何编码器或回归头。

Q2:SPARGen和G?VLM有什么区别?

A:G?VLM是通过引入专门的几何专家模块来统一几何预测和语言理解的,而SPARGen坚持只用预训练模型Bagel本身就有的图像生成通路和自回归通路来表达所有几何目标,不额外增加模块。实验显示SPARGen在多个空间推理基准上大幅超过G?VLM,比如MindCube基准上76.04分对28.48分。

Q3:SPARGen在实际测试中表现怎么样?

A:SPARGen在四个空间推理基准(MindCube、OmniSpatial、OST、SPAR)上全部拿到最高分,在深度估计上甚至超过了专门做几何重建的VGGT模型,在光流估计的KITTI零样本测试中也超过了专用光流模型FlowFormer。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
好残忍!人到中年,脸不是慢慢老的,是突然垮的......

好残忍!人到中年,脸不是慢慢老的,是突然垮的......

果壳
2026-08-22 20:12:22
不再保持中立,东盟多国集体选边,大军直奔台东,台海叙事已破产

不再保持中立,东盟多国集体选边,大军直奔台东,台海叙事已破产

历史的烟火
2026-08-23 02:02:02
今年,菲律宾果农盯着5.4万吨榴莲,做了一个大梦。他们以为,只要果子熟了,中国人就一定会来买

今年,菲律宾果农盯着5.4万吨榴莲,做了一个大梦。他们以为,只要果子熟了,中国人就一定会来买

扶苏聊历史
2026-08-22 14:45:41
官宣,全红婵上任,体育局任命,亮相新岗位

官宣,全红婵上任,体育局任命,亮相新岗位

泥说体育
2026-08-20 20:07:00
邮报:阿森纳球迷将措利斯比作桑切斯

邮报:阿森纳球迷将措利斯比作桑切斯

懂球帝
2026-08-23 04:32:27
“经常锻炼”被推翻?专家建议:过了50岁,最好保持5个锻炼习惯

“经常锻炼”被推翻?专家建议:过了50岁,最好保持5个锻炼习惯

牛锅巴小钒
2026-08-23 01:20:28
立秋后一定要补肺气,秋天里补肺第一名,煮水当茶喝,越喝肺越强

立秋后一定要补肺气,秋天里补肺第一名,煮水当茶喝,越喝肺越强

健身狂人
2026-08-21 01:08:47
忌惮显露!在美国看来,歼-16落地埃及,中东没人扛得住代价

忌惮显露!在美国看来,歼-16落地埃及,中东没人扛得住代价

陌上桃花开的
2026-08-23 01:24:47
张子宇全场仅7次出手,意大利女篮的紧逼包夹如何切断中国内线?

张子宇全场仅7次出手,意大利女篮的紧逼包夹如何切断中国内线?

林子说事
2026-08-23 02:05:01
特朗普:若输掉中期选举将被弹劾,霍尔木兹海峡现在是美国的领土,它就是美国的领土

特朗普:若输掉中期选举将被弹劾,霍尔木兹海峡现在是美国的领土,它就是美国的领土

大风新闻
2026-08-22 09:01:03
湖南两孩童遭生父继母长期虐待,体表淤青超47%,生母崩溃维权!

湖南两孩童遭生父继母长期虐待,体表淤青超47%,生母崩溃维权!

北有南栀
2026-08-21 18:25:03
紧急预警!超强台风沙德尔直扑东海,江浙沪直面硬刚,风雨大降温要来了

紧急预警!超强台风沙德尔直扑东海,江浙沪直面硬刚,风雨大降温要来了

糖逗在娱乐
2026-08-23 04:38:51
宇树科技下跌42%,在它面前只是弟弟

宇树科技下跌42%,在它面前只是弟弟

风风顺
2026-08-23 01:35:05
读完《羊脂球》发现:跟任何人交往,只要你表现出顺从、听话、胆怯,对方就会瞧不起你,这样只会放大别人的恶意,正确的做法是这样

读完《羊脂球》发现:跟任何人交往,只要你表现出顺从、听话、胆怯,对方就会瞧不起你,这样只会放大别人的恶意,正确的做法是这样

心理观察局
2026-08-20 06:43:05
万亿资产归零,全国第四大保险集团破产,1.5万亿保单怎么样了?

万亿资产归零,全国第四大保险集团破产,1.5万亿保单怎么样了?

米果说识
2026-08-17 19:17:49
“变性人”河莉秀:丈夫跑了,身体垮了,51岁骨骼比80岁老人还差

“变性人”河莉秀:丈夫跑了,身体垮了,51岁骨骼比80岁老人还差

探源历史
2026-08-22 01:26:41
10年后,我们可能根本无法抵制日货了,因为日元汇率已开始暴跌

10年后,我们可能根本无法抵制日货了,因为日元汇率已开始暴跌

牛锅巴小钒
2026-08-22 17:13:14
蓉城官方:一观众入场时晕倒抢救无效去世,俱乐部深表痛心

蓉城官方:一观众入场时晕倒抢救无效去世,俱乐部深表痛心

懂球帝
2026-08-23 02:02:07
浙江男子晒5辆豪车、179万余额,公司老板:他不是第一次冒充我儿子……

浙江男子晒5辆豪车、179万余额,公司老板:他不是第一次冒充我儿子……

小虎新车推荐员
2026-08-22 08:31:16
惨上加惨,赫尔城主场广播宣布曼彻斯特返程列车被取消

惨上加惨,赫尔城主场广播宣布曼彻斯特返程列车被取消

懂球帝
2026-08-22 22:11:17
2026-08-23 07:43:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9612文章数 568关注度
往期回顾 全部

科技要闻

苹果裁员200人:Vision Pro砍游戏团队

头条要闻

追觅造车办公地工位大片闲置 几十个总监集中在外求职

头条要闻

追觅造车办公地工位大片闲置 几十个总监集中在外求职

体育要闻

字母+汤神,有没有搞头?

娱乐要闻

《空枪》预测票房缩水,手握王炸都没赢

财经要闻

蔡昉解读经济:扩大消费需求的政策思考

汽车要闻

钛9全球首秀/四季度上市 方程S系列内饰车展亮相

态度原创

艺术
房产
教育
游戏
公开课

艺术要闻

60年里的惊人照片,记忆的定格!

房产要闻

两大热盘即将入市!三亚又一批安居房狠货要炸场了!

教育要闻

太康一中改名家印高中,要不要改过来?

《GTA6》泄露视频不见女主 黑客玩可能只是Demo

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版