打破黑盒猜想:“空间智能”的破局之路

2026-08-19 12:25:12 · chineseheadlinenews.com · 来源: AI科技评论

先来看一道简单的多模态大模型视觉考题:

观察给出的几张室内多视角照片,请回答:从图 1 的视角来看,蓝色椅面的办公椅右边是什么?

A. 单人沙发以及旁边的一张小桌子

B. 摆着微波炉的桌子

C. 小厨房

D. 蓝色垃圾桶

Qwen2.5-VL-7B精准选择了正确答案 A;LLaVA-OneVision-8B却选了 D。

按照以往的习惯,我们大概率会把原因归咎于模型在做多视角坐标转换时逻辑迷航了,或者它的空间推理能力不够,把左右相对位置搞混了。

但中山大学团队却在论文《SpatialSV: Internalizing Interpretable 3D Spatial Awareness in MLLMs via Task-Oriented Visual Supervision》中,给出了一个意想不到的答案。

研究团队像给模型做脑部 CT 诊断一样,提取出 LLaVA 在推理生成时的中间隐藏层特征,渲染成了一张 3D 空间点云图。 瞬间真相大白:在 LLaVA 脑海里建构的三维几何画卷中,那张作为关键参照物的“小桌子”,压根就没有被建模出来。

这项工作的核心价值,在于它打破了这种“黑盒猜想”。它用这套2D-to-3D 几何重建机制,不仅把大模型的视觉盲区看得清清楚楚,更找到了一条利用开源 3D 模型自动生成监督、砍掉 50% 人工文本标注的高性价比训练路线。

01

内部直接还原 3D 空间:训练时注入几何约束,推理时零延迟卸载

过去赋予多模态大模型 3D 感知能力,主要有两条路线:一是推理阶段接入外部深度模型,但这会显著增加推理延迟,且外部工具的误差容易传导至大模型;二是蒸馏 3D 基础模型的隐特征,但这种特征层面的对齐缺乏显式几何约束,且内部学习到的表征难以解释。

SpatialSV 的做法,是让模型在中间隐藏层直接将 2D 视觉特征提升(Lifting)为显式的 3D 几何表达。

SpatialSV 整体架构示意图

为了兼顾低阶几何细节与高阶跨模态语义,框架从大模型的中间隐藏层(以 Qwen2.5-VL 为例,选取第 4、12、20、28 层)提取特征,并映射到统一的三维特征空间中。

随后,解耦的轻量化 DPT 模块会接管这套特征,同步预测三项在几何上互为补充的显式表征。

首先是深度图的预测,主要用于确定场景中各物体的空间距离与前后层次,并通过引入梯度 Loss 专门抑制边缘模糊,保持物体的轮廓清晰。

其次是射线图。传统方法如果直接让模型预测相机的三维旋转矩阵,往往会因为矩阵的正交性约束导致优化不稳定;SpatialSV 转而预测每个像素的射线起点与方向,用这种更平滑的方式隐式建模相机位姿与观察视角,降低了学习难度。

最后是点云图,用来还原每个像素在三维物理世界中的真实空间坐标,并配合法向量 Loss 来约束几何表面的平整度与法向一致性。

深度、位姿与点云三者相互配合,共同在模型隐藏层内构建起一套严密的三维物理拓扑。

这些 3D 预测头与几何 Loss 仅在训练阶段参与优化,目的是将三维空间约束融入模型主干参数。进入推理阶段后,所有的 2D-to-3D 投影层与 DPT 预测头会被直接卸载。模型无需调用外部工具,也不产生额外的推理延迟,完全依靠内部形成的空间表征完成回答。

02

脑内点云当“CT 报告”:直接透视大模型的空间认知盲区

在评估多模态大模型的空间能力时,传统方法仅依赖最终的文本选项,难以确定模型答错的具体原因(如未能识别物体、方向判断失误或逻辑生成幻觉)。SpatialSV 预测出的 3D 重建结果,为观察模型的内部表征提供了可视化的窗口。

▎几何还原度决定得分上限:8 个主流模型的统一规律

研究团队在 8 个主流 MLLM(包括 Qwen2.5-VL、InternVL3、LLaVA 系列等)上做了深入的表征探测分析(Probing Analysis)的结果展现出清晰的规律:

从全局数据来看,模型的 3D 重建误差(RMSE)与空间问答准确率呈现出极强的负相关性——隐藏层对三维几何还原得越精准,模型最终在空间问答上的准确率就越高。

重建误差与准确率相关性曲线

如果进一步将测试集样本按照 3D 重建质量从差到好划分为四个梯队(Bin 1 到 Bin 4),所有模型的回答准确率均随重建质量的提升呈现出明显的阶梯式上涨。对于那些重建效果较差的样本,模型在实际问答中答错的概率显著更高。

按重建质量分梯队后的准确率趋势

这也意味着,通过观察模型生成的 3D 点云与深度图质量,甚至无需查看最终的文本输出,就能提前预判模型在哪些场景下可能判断失误。那些在三维渲染中出现断裂、坍塌或结构模糊的区域,正是模型在空间表征上的天然盲区。

▎错题病理分析:关键物体“隐形”与参照坐标系丢失

观察模型在隐藏层生成的深度图与点云,可以对模型的答错机制进行直观定位。

一种典型的失效模式是关键实体遗漏。在判断物体的相对位置时,答错的模型在点云重建中往往直接丢失了关键物体的几何结构(比如开篇案例中完全未被建模的小桌子)。当内部表征根本不存在该实体的三维轮廓时,后续的空间几何映射自然无法成立。

另一种常见情况则是空间锚点丢失。在涉及视角变换的推断任务中,模型需要依靠特定的物体作为坐标参考系。若隐藏层未能准确还原这些用于定位的参照实体(例如房间中作为方位参照的椅子),模型就无法在多视角之间建立连续的空间对应关系,进而引发方向判断上的偏差。

定性渲染诊断示例

这些实验表明,SpatialSV 生成的 3D 重建结果不仅可以作为训练阶段的约束项,也能作为诊断模型视觉表征缺陷的工具。开发者可以通过可视化的重建结果,精准定位模型是在几何细节感知、相机位姿校准还是空间对齐上存在瓶颈,进而进行针对性的数据补强或结构调优。

03

借力开源 3D 模型:砍掉 50% 人工文本标注,性能依然逼近全量

在 3D 空间理解领域,传统的训练路径通常高度依赖大规模的 3D 空间问答(3D VQA)数据集。但这类数据的标注成本极其高昂:标注人员不仅要标注物体的三维空间范围,还需要精确推算物体间的相对距离、遮挡关系与视角变化,并撰写成对应的自然语言问答对。高复杂度导致这类数据难以大规模量产;而与此同时,互联网上却存在着海量的无标注图像和视频。

SpatialSV 的破局思路,是将几何监督与自然语言问答彻底解耦。由于深度图、射线图和点云图属于纯视觉层面的物理表征,它们本身并不依赖人工编写的文本问答。在实际流程中,研发团队直接调用开源成熟的 3D 视觉基础模型(如 DepthAnything-v3、VGGT),对原始图像批量提取多视角深度图与相机参数,并进一步转化为点云与射线图,作为训练阶段的 3D 几何监督信号。这种方式在极低的人工干预下,自动为海量裸图赋予了精准的几何监督数据。

为了验证这套半监督方案的实际效果,论文在 Qwen2.5-VL-3B 模型上进行了对照实验。如果仅保留 50% 样本的文本问答,模型的空间问答准确率会从全量标注(100%)的 55.3% 显著下滑至 47.2%;但在同样只用 50% 文本标注的情况下,只要对剩余 50% 的无文本图像补充自动生成的 3D 几何监督,模型的准确率便能迅速回升至 53.9%,非常接近全量文本标注的水平,相比 50% 纯文本基线提升了 14.19%。

半监督学习实验对比。在仅有 50% 文本标注的情况下,加入无标注图像的 3D 几何监督后,模型性能(53.9%)非常接近全量文本标注的水平(55.3%),相比 50% 纯文本基线提升了 14.19%。

这组数狙酞空间大模型与具身智能系统的低成本训练提供了一条清晰的工程路径:未来不必完全依赖高成本的人工 3D 问答数据,只需用少量高质量文本完成语言对齐,同时借助开源 3D 模型自动生成的几何信号,就能让大模型在海量无标注真实场景图像中高效习得空间感知能力。

04

纯文字训练猜不出物理空间,大模型需要重补经典几何课

从整体设计来看,SpatialSV 除了在多个评测集上取得提升,更为多模态大模型如何理解物理空间提供了一次范式层面的反思。

目前主流的多模态大模型大多依赖自回归机制,通过预测下一个 Token来优化文本损失。然而,语言符号是高度抽象且离散的,真实物理世界中的空间关系(如深度层次、遮挡拓扑、视角旋转)却是连续且严密的几何结构。

仅仅依靠文本问答的对齐,模型很难在内部自发收敛出稳定的三维拓扑;一旦遭遇视角旋转或未见过的遮挡场景,所谓的“空间智能”就极易沦为空中楼阁。

SpatialSV 的突破,在于将计算机视觉中经典的密集预测任务(如深度估计、点云重建与位姿预测)作为辅助任务重新引入训练阶段。这种做法没有改变底层主流的 Transformer 架构,却给模型的中间表征加上了一套刚性的“几何正则化约束”,强迫大模型在学习语义的同时,在参数底层构建起对三维物理实体的真实感知。

更重要的是,它为具身智能打通了一条兼顾性能与成本的落地闭环:

在推理效率上,辅助预测头仅在训练阶段用于构建空间几何约束,在实际部署和推理时会被直接卸载,完全不产生额外的计算延迟与显存开销。

在可解释性方面,将内部几何特征转换为直观的可视化结果,为开发者提供了清晰的调试手段,能够准确排查模型答错是源于实体遗漏、位姿偏移还是语义幻觉。

而在数据成本层面,借助开源 3D 视觉基础模型自动生成几何监督信号,大幅降低了半监督训练对高成本人工 3D 问答标注的依赖,为具身智能系统的大规模训练打通了一条更具经济效益的闭环。

当大模型加速走向机器人与物理世界交互,单纯依靠“文字猜谜”已经不够用了。将显式几何约束重新注入大模型的内生表征,或许正是通向真正空间智能(Spatial Intelligence)与物理世界模型最务实的一条捷径。


    24小时新闻排行榜更多>>
  1. 全球资金正重新定价“更高资本成本”
  2. 人生所有相遇 皆是修行
  3. 朱镕基告别式 儿女反应大不同 李瑞环、温家宝送花圈
  4. 血管堵塞真相被找到,3种食物要远离
  5. 福建晋江又一惊天大火 传讨薪员工献忠死伤百人
  6. 习近平为啥招人恨? 人家偷驴 他“拔橛子”
  7. 一场酒局献祭,掀开了杭州地产潜规则
  8. 三餐安排在这些时间,不容易胖更健康
  9. 一粒尘埃可能就是一个宇宙?
  10. 美逾半选民自认处境更差 更多民众不满经济政策
  11. 想长寿,晚餐牢记5个“不”
  12. “90后”新首富:全世界都担心这件事
  13. 鸦片战争还有这一幕:英军竟打出“反清复明”旗号
  14. 985大学开在县城,“考进大山了”
  15. 60亿庆功宴爆丑闻 女员工疑被灌醉性侵致脾脏破裂
  16. 小扎开出“1亿美元年薪”,也没能留住他
  17. 朱镕基葬礼在北京举行,当局谨慎应对公众情绪
  18. 结束冲突无望,川普竟威胁要炸阿曼
  19. 瑞幸翻车,花钱围观陌生人谈恋爱
  20. 传奇大佬,30楼坠亡
  21. 副区长先来,赵总没来成,就将女生撞成轻伤?
  22. 金融时报:北京放行H200 字节跳动,腾讯各收1万颗
  23. 最佳高中排名:南加华人区多校名列前茅
  24. 攻击朋友、讨好敌人:川普“黑白颠倒”的世界观
  25. 海内外港人民调 88%受访者给李家超0分 98%对一国两制没信心
  26. 如果北京武力攻台,普通人能“保卫台湾”吗?
  27. 反击川普!伊朗大使馆喊"加州是伊朗新领土"
  28. AI稿件淹没出版业 以后畅销小说不再靠人类“手搓”?
  29. 四川一农家升学宴上墙体倒塌 致5死17伤
  30. AI 时代的一个根本矛盾:能力变了,制度还没跟上
  31. 美军护航奏效 伊朗正失去霍尔木兹海峡主导权
  32. 一眼心动,雾水疏树——吴冠中《富春江沙洲》
  33. 波斯湾的美军,要跑路了?
  34. 最新公开露面,朝鲜公主变了?
  35. 经济放缓、"扫黑除恶"下中国民商事律师评估风险
  36. 台湾立院三读通过两法 行政院:不予副署
  37. 许老板“崩”了东北富二代42亿
  38. 赵本山女儿患精神疾病十余年
  39. 宇树科技上市首日,十大看点预测
  40. TVB女星宣布和富二代男友分手
  41. 偶遇郭碧婷向佐带娃,女儿像极了洋娃娃
  42. 欧洲人为啥那么松弛?中国人为啥那么累?
  43. 世间已无朱鎔基,论者称中国需要制约"权力"的制度
  44. 范氏家族为什么能八百年兴盛不衰?
  45. 《2026年杰青名单》已经外泄
  46. 纽约时报:战争和权力的新物理规律
  47. 大理石上的美妙纹理 原来是这样形成的!
  48. 华人男女涉无证经营按摩店被捕
  49. 吴冠中de私藏精品
  50. DeepSeek Harness 被骂惨了
  51. 董璇带小酒窝探班,周也不愿放手
  52. 杨迪自爆离谱往事,错把谢娜知遇当暗恋
  53. 硬盘可靠度排行榜出炉,第一名已退出市场
  54. 核武问题打伊朗哄朝鲜 川普的盘算恐会再次落空
  55. 宇树股价暴涨,王兴兴上演IPO名场面
  56. 金融时报:伊朗评估攻击"欧洲2国"美军基地扩大战局
  57. 硅谷第一夫人的狗血上位史
  58. 蚂蚁分拆融资启幕:AI挂帅,金融托底
  59. 泽伦斯基面临开战以来最大政治危机
  60. 巧用毛巾妙招 对身体有10大益处