打破黑盒猜想:“空间智能”的破局之路
2026-08-19 12:25:12 · chineseheadlinenews.com · 来源: AI科技评论
先来看一道简单的多模态大模型视觉考题:
观察给出的几张室内多视角照片,请回答:从图 1 的视角来看,蓝色椅面的办公椅右边是什么?

A. 单人沙发以及旁边的一张小桌子
B. 摆着微波炉的桌子
C. 小厨房
D. 蓝色垃圾桶
Qwen2.5-VL-7B精准选择了正确答案 A;LLaVA-OneVision-8B却选了 D。
按照以往的习惯,我们大概率会把原因归咎于模型在做多视角坐标转换时逻辑迷航了,或者它的空间推理能力不够,把左右相对位置搞混了。
但中山大学团队却在论文《SpatialSV: Internalizing Interpretable 3D Spatial Awareness in MLLMs via Task-Oriented Visual Supervision》中,给出了一个意想不到的答案。

研究团队像给模型做脑部 CT 诊断一样,提取出 LLaVA 在推理生成时的中间隐藏层特征,渲染成了一张 3D 空间点云图。 瞬间真相大白:在 LLaVA 脑海里建构的三维几何画卷中,那张作为关键参照物的“小桌子”,压根就没有被建模出来。
这项工作的核心价值,在于它打破了这种“黑盒猜想”。它用这套2D-to-3D 几何重建机制,不仅把大模型的视觉盲区看得清清楚楚,更找到了一条利用开源 3D 模型自动生成监督、砍掉 50% 人工文本标注的高性价比训练路线。
01
内部直接还原 3D 空间:训练时注入几何约束,推理时零延迟卸载
过去赋予多模态大模型 3D 感知能力,主要有两条路线:一是推理阶段接入外部深度模型,但这会显著增加推理延迟,且外部工具的误差容易传导至大模型;二是蒸馏 3D 基础模型的隐特征,但这种特征层面的对齐缺乏显式几何约束,且内部学习到的表征难以解释。
SpatialSV 的做法,是让模型在中间隐藏层直接将 2D 视觉特征提升(Lifting)为显式的 3D 几何表达。

SpatialSV 整体架构示意图
为了兼顾低阶几何细节与高阶跨模态语义,框架从大模型的中间隐藏层(以 Qwen2.5-VL 为例,选取第 4、12、20、28 层)提取特征,并映射到统一的三维特征空间中。
随后,解耦的轻量化 DPT 模块会接管这套特征,同步预测三项在几何上互为补充的显式表征。
首先是深度图的预测,主要用于确定场景中各物体的空间距离与前后层次,并通过引入梯度 Loss 专门抑制边缘模糊,保持物体的轮廓清晰。
其次是射线图。传统方法如果直接让模型预测相机的三维旋转矩阵,往往会因为矩阵的正交性约束导致优化不稳定;SpatialSV 转而预测每个像素的射线起点与方向,用这种更平滑的方式隐式建模相机位姿与观察视角,降低了学习难度。
最后是点云图,用来还原每个像素在三维物理世界中的真实空间坐标,并配合法向量 Loss 来约束几何表面的平整度与法向一致性。
深度、位姿与点云三者相互配合,共同在模型隐藏层内构建起一套严密的三维物理拓扑。
这些 3D 预测头与几何 Loss 仅在训练阶段参与优化,目的是将三维空间约束融入模型主干参数。进入推理阶段后,所有的 2D-to-3D 投影层与 DPT 预测头会被直接卸载。模型无需调用外部工具,也不产生额外的推理延迟,完全依靠内部形成的空间表征完成回答。
02
脑内点云当“CT 报告”:直接透视大模型的空间认知盲区
在评估多模态大模型的空间能力时,传统方法仅依赖最终的文本选项,难以确定模型答错的具体原因(如未能识别物体、方向判断失误或逻辑生成幻觉)。SpatialSV 预测出的 3D 重建结果,为观察模型的内部表征提供了可视化的窗口。
▎几何还原度决定得分上限:8 个主流模型的统一规律
研究团队在 8 个主流 MLLM(包括 Qwen2.5-VL、InternVL3、LLaVA 系列等)上做了深入的表征探测分析(Probing Analysis)的结果展现出清晰的规律:
从全局数据来看,模型的 3D 重建误差(RMSE)与空间问答准确率呈现出极强的负相关性——隐藏层对三维几何还原得越精准,模型最终在空间问答上的准确率就越高。

重建误差与准确率相关性曲线
如果进一步将测试集样本按照 3D 重建质量从差到好划分为四个梯队(Bin 1 到 Bin 4),所有模型的回答准确率均随重建质量的提升呈现出明显的阶梯式上涨。对于那些重建效果较差的样本,模型在实际问答中答错的概率显著更高。

按重建质量分梯队后的准确率趋势
这也意味着,通过观察模型生成的 3D 点云与深度图质量,甚至无需查看最终的文本输出,就能提前预判模型在哪些场景下可能判断失误。那些在三维渲染中出现断裂、坍塌或结构模糊的区域,正是模型在空间表征上的天然盲区。
▎错题病理分析:关键物体“隐形”与参照坐标系丢失
观察模型在隐藏层生成的深度图与点云,可以对模型的答错机制进行直观定位。
一种典型的失效模式是关键实体遗漏。在判断物体的相对位置时,答错的模型在点云重建中往往直接丢失了关键物体的几何结构(比如开篇案例中完全未被建模的小桌子)。当内部表征根本不存在该实体的三维轮廓时,后续的空间几何映射自然无法成立。
另一种常见情况则是空间锚点丢失。在涉及视角变换的推断任务中,模型需要依靠特定的物体作为坐标参考系。若隐藏层未能准确还原这些用于定位的参照实体(例如房间中作为方位参照的椅子),模型就无法在多视角之间建立连续的空间对应关系,进而引发方向判断上的偏差。

定性渲染诊断示例
这些实验表明,SpatialSV 生成的 3D 重建结果不仅可以作为训练阶段的约束项,也能作为诊断模型视觉表征缺陷的工具。开发者可以通过可视化的重建结果,精准定位模型是在几何细节感知、相机位姿校准还是空间对齐上存在瓶颈,进而进行针对性的数据补强或结构调优。
03
借力开源 3D 模型:砍掉 50% 人工文本标注,性能依然逼近全量
在 3D 空间理解领域,传统的训练路径通常高度依赖大规模的 3D 空间问答(3D VQA)数据集。但这类数据的标注成本极其高昂:标注人员不仅要标注物体的三维空间范围,还需要精确推算物体间的相对距离、遮挡关系与视角变化,并撰写成对应的自然语言问答对。高复杂度导致这类数据难以大规模量产;而与此同时,互联网上却存在着海量的无标注图像和视频。
SpatialSV 的破局思路,是将几何监督与自然语言问答彻底解耦。由于深度图、射线图和点云图属于纯视觉层面的物理表征,它们本身并不依赖人工编写的文本问答。在实际流程中,研发团队直接调用开源成熟的 3D 视觉基础模型(如 DepthAnything-v3、VGGT),对原始图像批量提取多视角深度图与相机参数,并进一步转化为点云与射线图,作为训练阶段的 3D 几何监督信号。这种方式在极低的人工干预下,自动为海量裸图赋予了精准的几何监督数据。
为了验证这套半监督方案的实际效果,论文在 Qwen2.5-VL-3B 模型上进行了对照实验。如果仅保留 50% 样本的文本问答,模型的空间问答准确率会从全量标注(100%)的 55.3% 显著下滑至 47.2%;但在同样只用 50% 文本标注的情况下,只要对剩余 50% 的无文本图像补充自动生成的 3D 几何监督,模型的准确率便能迅速回升至 53.9%,非常接近全量文本标注的水平,相比 50% 纯文本基线提升了 14.19%。

半监督学习实验对比。在仅有 50% 文本标注的情况下,加入无标注图像的 3D 几何监督后,模型性能(53.9%)非常接近全量文本标注的水平(55.3%),相比 50% 纯文本基线提升了 14.19%。
这组数狙酞空间大模型与具身智能系统的低成本训练提供了一条清晰的工程路径:未来不必完全依赖高成本的人工 3D 问答数据,只需用少量高质量文本完成语言对齐,同时借助开源 3D 模型自动生成的几何信号,就能让大模型在海量无标注真实场景图像中高效习得空间感知能力。
04
纯文字训练猜不出物理空间,大模型需要重补经典几何课
从整体设计来看,SpatialSV 除了在多个评测集上取得提升,更为多模态大模型如何理解物理空间提供了一次范式层面的反思。
目前主流的多模态大模型大多依赖自回归机制,通过预测下一个 Token来优化文本损失。然而,语言符号是高度抽象且离散的,真实物理世界中的空间关系(如深度层次、遮挡拓扑、视角旋转)却是连续且严密的几何结构。
仅仅依靠文本问答的对齐,模型很难在内部自发收敛出稳定的三维拓扑;一旦遭遇视角旋转或未见过的遮挡场景,所谓的“空间智能”就极易沦为空中楼阁。
SpatialSV 的突破,在于将计算机视觉中经典的密集预测任务(如深度估计、点云重建与位姿预测)作为辅助任务重新引入训练阶段。这种做法没有改变底层主流的 Transformer 架构,却给模型的中间表征加上了一套刚性的“几何正则化约束”,强迫大模型在学习语义的同时,在参数底层构建起对三维物理实体的真实感知。
更重要的是,它为具身智能打通了一条兼顾性能与成本的落地闭环:
在推理效率上,辅助预测头仅在训练阶段用于构建空间几何约束,在实际部署和推理时会被直接卸载,完全不产生额外的计算延迟与显存开销。
在可解释性方面,将内部几何特征转换为直观的可视化结果,为开发者提供了清晰的调试手段,能够准确排查模型答错是源于实体遗漏、位姿偏移还是语义幻觉。
而在数据成本层面,借助开源 3D 视觉基础模型自动生成几何监督信号,大幅降低了半监督训练对高成本人工 3D 问答标注的依赖,为具身智能系统的大规模训练打通了一条更具经济效益的闭环。
当大模型加速走向机器人与物理世界交互,单纯依靠“文字猜谜”已经不够用了。将显式几何约束重新注入大模型的内生表征,或许正是通向真正空间智能(Spatial Intelligence)与物理世界模型最务实的一条捷径。