南大:自进化神经符号技能提升空间推理

南大:自进化神经符号技能提升空间推理 标题Self-Evolving Neuro-Symbolic Skills for Tool-Augmented Spatial Reasoning来源arXiv, 2608.07955️文章简介研究问题如何让大型视觉语言模型通过积累可复用的技能而非从零规划或依赖固定流程来实现可靠的细粒度空间推理主要贡献论文提出NeSy-Spatial框架将工具调用和几何计算抽象为类型化可执行原子指令并组合成可自进化的高层技能在三个空间推理基准上显著提升准确性。重点思路定义两类互补技能工具使用技能组织外部工具执行顺序和依赖关系几何技能提供可验证的几何计算代码块如坐标变换、距离计算等。将原子指令设计为带局部验证器的类型化可执行操作高层技能表示为节点-边-上下文结构支持灵活的依赖编排。推理阶段采用闭环流程技能检索、动作选择、工具/代码执行、状态更新动态适应中间结果。进化阶段从成功和失败轨迹中挖掘新原子指令和局部规则与现有技能融合并根据验证结果和使用模式剪枝不可靠或不活跃条目。采用两阶段技能检索先用紧凑描述筛选相关技能再展开完整定义减少上下文长度。分析总结在GPT-5.4骨干上NeSy-Spatial在MMSI、MindCube、OmniSpatial三个基准上平均准确率达94.56%显著优于最佳基线AWM的87.39%。在Gemini 2.5 Pro上平均准确率60.3%远超最佳基线38.12%证明框架对不同模型的通用性。Python执行成功率平均达95.45%表明几何技能有效提升了代码生成的可靠性。消融实验显示自进化机制相比固定技能库在累积准确率上持续提升验证了技能进化的有效性。个人观点论文将空间推理经验结构化为可复用的技能库而不是每次都从头规划工具调用从历史轨迹中提炼出工具使用流程和几何计算模板并在实践中不断优化。