🧠 PsyBrain 脑心前沿关注公众号
字号
主题
PsyBrain 脑心前沿 / AI 与脑科学:顶刊文献解读专题 / A · 文献解读 / A050 · 清华团队动态神经网络实现类似人类视觉系统的自适应主动感知

A050 清华团队 | 动态神经网络实现类似人类视觉系统的自适应主动感知

来源:公众号 PSY-Brain_Frontier | 发布:2025-11-17 | 原文链接

PsyBrain 脑心前沿 | 公众号 PSY-Brain_Frontier

一键关注,点亮星标 ⭐️

不错过每日前沿资讯

认知神经科学前沿文献分享

图1

基本信息

Title:Emulating human-like adaptive vision for efficient and flexible machine visual perception

发表时间:2025.11.6

Journal:Nature Machine Intelligence

影响因子:23.9

获取原文:

  1. 后台回复“文献”即可获取PDF版本
  2. 点击页面底部“阅读原文”即可跳转论文原网页

图2

图3

引言

我们每天都在“有选择地看”。走在路上,眼睛会先扫一眼路况,再迅速把清晰的中央视野(fovea)落到红绿灯、行人或突然驶来的电动车上;做PPT汇报时,我们会先粗看一页版面结构,再把注意力落到关键图表、峰值和误差条上。人类视觉的高效之处,就在于主动(active)与自适应(adaptive):不会把每个像素都同等对待,而是串行地在少数任务相关区域上进行“凝视”(fixations),并在多次凝视的过程中逐步整合信息,到“够了”为止再做决策。这种“由粗到细”(coarse-to-fine)的策略既节能,又能在复杂场景里快速抓住重点。

图4

与此相对,主流的机器视觉模型(无论是CNN还是ViT)大多采取被动方式:一次性把整张图像或视频帧全部喂入网络,并行计算所有像素的特征。这在模型与输入分辨率“齐涨”的今天带来巨大代价——算力、显存、延迟与碳排都会随像素数线性(宽高则近似二次)增长;当分辨率从28×28扩到224×224、再到驾驶场景常见的900×1600时,资源需求猛增数十倍到上千倍,让真实世界部署举步维艰(如可穿戴设备、移动端、机器人、车载系统与医疗设备,往往要求低延迟、低功耗)。更雪上加霜的是,大模型“越大越强”的经验(scaling laws)正在强化“继续放大”的趋势,与高时空分辨率输入的需求叠加,形成研究者在文中称之为机器视觉的“不可能三角”:要能力、要高分辨率/高帧率,还要高效率——三者很难兼得。

图5

那么,能否像人一样“只看有用的地方、只看必要的时间”,把主动与自适应真正引入到通用机器视觉?本文作者提出了AdaptiveNN这一通用框架,试图系统性地把“由粗到细、串行凝视、足够即停”的人类视觉策略,迁移到深度视觉模型的推理过程中。它把视觉感知过程建模为一个多步的序列决策:先快速“瞥一眼”,再迭代选择下一个要看的区域(fixation),每一步把新区域抽取的深特征与内部表示(internal representation)进行融合,同时评估“是否该结束观察”。若“值不值得再看”低于阈值,就停止并输出任务结果;若仍有收益,就继续选定新的凝视区域。关键的是,作者提出了一个把表征学习(representation learning)与自奖励型强化学习(self-rewarding reinforcement learning)统一起来的理论与训练准则,从而在不需要额外标注凝视位置的情况下,实现对这一不可导决策过程的端到端学习。

为什么这很重要?在真实应用中,“看得准,又看得省”才是王道。作者在17个基准、9类任务上验证了AdaptiveNN,包括ImageNet大规模识别、六个细粒度数据集、真实驾驶路景交通标志识别、可变目标数量/类别的视觉搜索、医疗影像肺炎检测、语言驱动的机器人操作,以及与人类凝视行为的并排对比。结果显示:在不牺牲精度的前提下,推理开销最多可降至1/28;并且无需再训练即可在线调节平均开销与性能折中;模型的凝视轨迹还带来更好的可解释性,在多项测试中与人类行为高度一致,甚至通过“视觉图灵测试”做到与人类难以区分。这为“高效、灵活、可解释”的下一代机器视觉打开了新的方向。

图6

省流总结

背景与问题:大模型+高分辨率输入使视觉推理成本高企,形成“能力—分辨率—效率”的不可能三角。

方法:提出AdaptiveNN,把视觉建模为“瞥一眼→多次凝视→足够即停”的序列决策,并以表征学习+自奖励强化学习的统一理论端到端训练,无需凝视标注。

核心结果:在17基准/9任务上,最高28×降成本且不降精度,可在线调节开销;凝视模式带来可解释性,对人类对比与图灵测试表现出高度相似。

意义:为高效、灵活、可解释的通用机器视觉提供通用范式,可拓展至多模态与具身智能。

图7

研究背景

深度视觉近年的成功建立在“更大的模型×更高的分辨率×更多的数据”上。然而推理端的“线性像素开销”和“二次分辨率开销”让现实应用难以承载,尤其当我们需要在机器人、车载、移动端、医疗影像等低时延、低功耗场景中实时反应。同时,Scaling Laws鼓励我们持续放大模型规模和输入尺寸,进一步加剧资源消耗与延迟,形成论文提出的不可能三角:能力与分辨率要上去,效率却下不来。

人类视觉长期被认作打破三角的“范本”:主动、选择性、由粗到细、足够即停。它通过眼动把“清晰的中央凹”移动到几个任务相关区域,多次凝视中逐步整合信息;开销主要取决于凝视带宽×凝视次数,而非整张图像大小,这让人类能用有限资源处理极复杂的真实世界。尽管早在2015年就有人呼吁深度学习应转向“智能地决定看哪儿”,但已有工作多局限于特定任务或小规模数据,只取得有限的效率收益,缺少统一、可泛化的理论与框架。

基于此,作者希望回答三类关键科学问题:

1)如何把“主动—自适应—串行”的人类视觉范式,迁移到通用计算机视觉?

2)如何在不额外标注“人眼看哪”的情况下,端到端学会“看哪儿、看多久、何时停”?

3)这种机制能否在多任务、跨架构与真实场景下稳定工作,并带来效率、灵活性与可解释性的三重收益?

为此,AdaptiveNN被设计为与CNN/Transformer等特征骨干兼容的通用接口:它不是重新发明特征提取网络,而是把“看哪里+看多久”这件事单独建模为一个决策代理(policy+value),并与特征学习联合训练。这个决策代理既考虑当前内部表征已掌握的内容,也考虑外部任务需求(可被文本prompt指定),最终在不改变原有任务目标函数的前提下,学会“划算地看”。

图8

Fig. 1 | The impossible triangle faced by the current framework of machine visual perception

图9

实验设计

AdaptiveNN 的推理从一次“快速一瞥”(glance)开始:把整张图像下采样到与单次凝视相同的带宽,快速构建一个初始内部表示 s0s_0s0。随后进入序列决策循环:在第 ttt 步,决策代理接收当前表示 sts_tst,一方面由策略网络(policy π\piπ)给出下一处凝视位置 lt+1l_{t+1}lt+1 的概率分布并采样,另一方面由价值网络(value VπV_\piVπ)评估“若继续观察可能获得的增益”并与阈值 ηt\eta_tηt 比较;若收益不足则终止观察并输出结果,否则裁剪该位置的局部区域,送入感知网络(frep)提取深特征,与 sts_tst 融合为 st+1s_{t+1}st+1,进入下一轮。训练上,作者提出把期望任务损失的梯度严格分解为两部分:一是对所有中间步输出的表征学习梯度,二是对凝视位置分布的自奖励型强化学习梯度,其中奖励来自任务损失本身而非外部标注,从而在无凝视监督下端到端学会“看哪里/何时停”。prompt可改变任务指令,使模型在“看哪里/看多久”的策略上随任务切换而条件化。

图10

图11

图12

Fig. 2 | Schematic overview of AdaptiveNN

图13

核心发现

发现一|在 ImageNet 大规模识别上,AdaptiveNN 以更少算力达到同等精度

作者将AdaptiveNN与两类典型骨干(ResNet与DeiT)结合,在ImageNet-1K上比较精度—GFlops曲线。结果显示:AdaptiveNN-DeiT-S与AdaptiveNN-ResNet-50在2.86/3.37 GFLOPs/图的开销下,分别达到81.6%/79.1%的Top-1验证精度,与其非自适应对照相当,但效率提升约5.4×/3.6×。图3还展示了凝视次数与精度的关系:凝视越多,平均精度显著提升(P<0.005);同时,在给定算力预算时,AdaptiveNN会把更多凝视分配给“更难”的样本、把更少凝视分给“更容易”的样本,以优化整体资源分配(这一点从不同预算下的凝视次数分布可见)。定性上,模型学会盯住类别判别性部位(如动物头部、乐器主体、咖啡机的旋钮与喷嘴),在目标很小或视角异常时自动延长观察,体现出与人眼相似的难度自适应行为。

图14

图15

图16

Fig. 3 | Results of ImageNet large-scale real-world visual understanding.

发现二|细粒度识别省算显著,且可解释性更强

六个经典细粒度数据集(CUB-200-2011、NABirds、Oxford-IIIT Pet、Stanford Dogs、Stanford Cars、FGVC-Aircraft)验证了AdaptiveNN在“细微差异、强背景干扰”的场景里的价值:在不牺牲精度的前提下,平均计算量可降低数倍(文中报告6.2×、6.1×、7.6×、8.2×、5.8×、6.3×等量级),且定性可视化显示模型自发把凝视落在喙、车灯、引擎/螺旋桨等细粒度判别部位,无需任何显式定位监督。这种“看对地方”的属性,一方面解释了为什么少算力仍能保精度,另一方面也天然提供了人可读的解释:模型到底关注了哪些细节,用于支撑判断。

图17

Extended Data Fig. 1 | Results on six fine-grained visual recognition  benchmarks

发现三|在真实驾驶场景(STSD)上实现近28×降本,且能纠正初始误判

路景图像非物体居中、目标往往很小且分布多样。作者在STSD交通限速标志识别上对比:非自适应ResNet-50约76 GFLOPs/图,而AdaptiveNN仅约2.7 GFLOPs/图,在接近28×的降本下,90.2%的精度仍能保持。定性图显示,凝视会迅速聚焦到小而重要的目标区域,并可在早期“看走眼”时通过后续凝视基于上下文纠正,这与人类在复杂路况下的浏览与复核很相似。

图18

Fig. 4 | Assessment of AdaptiveNN in more general visual perception scenarios: processing images from real driving and medical scenarios, and visual search tasks with variable demands.

发现四|灵活应对“任务需求变化”,显著优于既有序列视觉模型

作者构造了“多数字定位”的视觉搜索任务:一张224×224的图中随机放置6–10个28×28的MNIST数字,任务是根据可变的目标类别与数量把所有指定数字的位置都找出来。AdaptiveNN在各种目标个数下成功率约90%,显著优于经典RAM/DRAM(约<20%),说明它不仅学会“看哪里”,还能够条件化地根据任务描述调整凝视策略与停止时机。定性结果可见,在目标多或更难时自动加长观察、在简单任务时尽快结束,从而按需分配计算。

发现五|在医疗影像中同时提升诊断与可解释性,凝视与放射科医生标注高度一致

在RSNA肺炎X光数据集(~3万张胸片)上,作者仅用图像级标签训练模型(未用病灶框作监督),结果在验证集上AUROC显著优于非自适应模型(P<0.0001)。更重要的是,AdaptiveNN的凝视区域与18位放射科医师标注的肺不透明区存在高度重叠,这种“弱监督下的定位一致性”为医疗场景提供了更可信的决策依据:不仅预测更准,而且“看对地方”,让医生可以审视推理链条并建立信任。

发现六|嵌入具身多模态大模型,长序列指令下以**4.4–5.9×降本保持成功率,并能在线调参

作者把AdaptiveNN作为感知模块,整合到基于OpenFlamingo/RoboFlamingo的具身MLLM中,在CALVIN长程多子任务语言控制基准上评估。结果:在两种数据规模设置(D→D与ABCD→D)下,推理成本下降4.4–5.9×而不牺牲平均成功长度;通过在线调整凝视分布即可在不重训的情况下平滑改变成本—效果折中。分任务分析显示,凝视次数增加带来成功率稳步提升,尤其在训练数据更大更多样时趋势更显著;定性上,模型能将凝视对准指令相关物体及与机械臂交互的关键接触部位,难任务多看、易任务少看。

图19

Fig. 5 | Performance of the embodied MLLMs based on AdaptiveNN.

发现六|与人类视觉的并排对比与图灵测试显示高度一致,难以区分

在SALICON自由观看凝视数据上,AdaptiveNN选取的凝视区域与人类聚焦区域高度一致,量化上可达或超过单个平均观察者;在“难度评估”上,模型的状态值与10位人类对类别样本“难易度”的评分显著正相关(ρ=0.54–0.80,均P<0.0001)。更进一步的视觉图灵测试中,39名志愿者在“机器vs人类”的二选一任务里,识别准确率仅50–51%,与随机猜测无显著差异,同时明显区别于“随机vs人类”的容易任务(≥80%)。这意味着AdaptiveNN在空间凝视与样本难度评估两方面都接近不可区分的人类水平。

图20

图21

Fig. 6 | Behavioural comparisons between AdaptiveNN and human vision.

图22

结论

AdaptiveNN以清晰的人类视觉启发和扎实的统一训练理论,把“看哪里/何时停”的序列决策自然融入到通用视觉流程中,在不牺牲精度的同时带来数量级的推理降本,并兼具在线可调与可解释。跨任务、跨架构与多模态设置的系统性验证,使其成为打破“不可能三角”的有力范式。

图23

展望与应用

未来值得追问的方向:

1)视频与多尺度凝视:将当前单尺度方块式凝视扩展为多尺度/可变形凝视,适配更长时域的视频理解与时空权衡。

2)与规划/思维链整合:把视觉“凝视序列”与语言/动作的“推理序列”联动,让模型在感知—决策—行动链条中统一优化(文中已在具身MLLM方向迈出一步)。

3)安全与不确定性感知:在自动驾驶/医疗等高风险场景中,引入风险敏感的停止准则与不确定性估计,实现“高风险多看、低风险快看”。

4)人机共适配:利用凝视轨迹作为人机对齐的渠道,支持医生/驾驶员在交互中“点出”关注处,反向塑造模型的凝视策略。

5)更广泛的人类对比:扩展图灵测试的范式与数据,比较凝视次序、微眼动等更细层信号,进一步验证与解释“人样行为”的边界。

图24

文章作者信息

第一作者:Yulin Wang,Yang Yue,Yang Yue

清华大学自动化系(Department of Automation, Tsinghua University)。研究方向:计算机视觉、模型效率与自适应感知等。

通讯作者:Shiji Song,Gao Huang

清华大学自动化系

shijis@tsinghua.edu.cn,gaohuang@tsinghua.edu.cn

刊物与时间(Journal & Dates):Nature Machine Intelligence;收稿:2025-03-02,接收:2025-09-09,在线发表待更新(Online: 2025-11-06)。

图25

Abstract

Human vision is highly adaptive, efficiently sampling intricate environments by sequentially fixating on task-relevant regions. In contrast, prevailing machine vision models passively process entire scenes at once, resulting in excessive resource demands scaling with spatial–temporal input resolution and model size, yielding critical limitations impeding both future advancements and real-world application. Here we introduce AdaptiveNN, a general framework aiming to enable the transition from ‘passive’ to ‘active and adaptive’ vision models. AdaptiveNN formulates visual perception as a coarse-to-fine sequential decision-making process, progressively identifying and attending to regions pertinent to the task, incrementally combining information across fixations and actively concluding observation when sufficient. We establish a theory integrating representation learning with self-rewarding reinforcement learning, enabling end-to-end training of the non-differentiable AdaptiveNN without additional supervision on fixation locations. We assess AdaptiveNN on 17 benchmarks spanning 9 tasks, including large-scale visual recognition, fine-grained discrimination, visual search, processing images from real driving and medical scenarios, language-driven embodied artificial intelligence and side-by-side comparisons with humans. AdaptiveNN achieves up to 28 times inference cost reduction without sacrificing accuracy, flexibly adapts to varying task demands and resource budgets without retraining, and provides enhanced interpretability via its fixation patterns, demonstrating a promising avenue towards efficient, flexible and interpretable computer vision. Furthermore, AdaptiveNN exhibits closely human-like perceptual behaviours in many cases, revealing its potential as a valuable tool for investigating visual cognition.

图26

相关阅读

周报-20251006 | 近两周解读的29篇顶刊论文汇总 | 认知神经科学前沿动态 ⭐️[解读链接]

周报-20250922 |认知神经科学前沿动态周览 *⭐️[解读链接]***

周报-20251020|认知神经科学前沿动态周览**⭐️[ 解读链接 ]****

Nature |决策过程的动力学机制与神经模式转变 ⭐️[解读链接]

Nature |颠覆认知 ! “神经振荡”不成立?耶鲁团队提出大脑“伽马事件”新理论  ⭐️[解读链接]

Science |中国将领衔未来25年全球脑计划,剑指灵长类大脑地图  *⭐️[解读链接]***

Neuron |大脑如何区分现实与想象?伦敦大学学院团队最新研究揭秘“现实信号”的神经密码 ⭐️[解读链接]

Nature | 视觉系统新发现:压缩式的物体识别机制 ⭐️[解读链接]

Nat Hum Behav|你不是天生就爱跟风:社会特征学习理论揭示人类“随大流”背后的秘密  *⭐️[解读链接]***

Nature |“读心术”成真?从瞳孔变化中解码大脑皮层完整时空动态 ⭐️[解读链接]

PNAS|刷短视频停不下来?研究揭示“新奇感”是驱动人类探索的古老密码 *⭐️[解读链接]***

Neuron | 最强脑发育数据库RBC开放下载,6000+青少年大脑数据揭示精神健康的秘密 ⭐️[解读链接]

Nature 子刊综述|大脑预测误差的核心回路 *⭐️[解读链接]***

前沿交流 | 欢迎加入认知神经科学前沿交流群!⭐️[解读链接]

图27

核心图表、方法细节、统计结果与讨论见原文及其拓展数据。

分享人:BQ

审核:PsyBrain 脑心前沿编辑部

图28

PsyBrain 脑心前沿

带你了解心理学、脑科学的前沿知识与技术流程

预览时标签不可点

阅读原文

不喜欢

微信扫一扫
关注该公众号

知道了

微信扫一扫
使用小程序

取消 允许

取消 允许

取消 允许

× 分析

跳转二维码

图29

微信扫一扫可打开此内容,
使用完整服务

返回板块首页