🧠 PsyBrain 脑心前沿关注公众号
字号
主题
PsyBrain 脑心前沿 / 科研分析:认知神经科学前沿的结构化精读 / X · AI 与脑科学 / X020 · NatMachIntell按人类“视觉发育食谱”训练AI

X020 Nat Mach Intell |按人类“视觉发育食谱”训练AI,真的能让模型更像人类看世界吗?

来源:公众号 PSY-Brain_Frontier | 发布:2026-04-30 | 原文链接

图1

认知神经科学前沿文献分享

图2

基本信息

Title: Adopting a human developmental visual diet yields robust and shape-based AI vision

发表时间: 2024.4.24

发表期刊:Nature Machine Intelligence

获取原文:

  1. 添加小助手: PSY-Brain-Frontier 即可获取PDF版本

  2. 点击页面底部“阅读原文”跳转论文网页

图3

图4

引言

这些年,人工智能视觉系统在规模、参数量和训练数据上一路扩张,但它与人类视觉之间的“错位”并没有因此自动消失。一个最典型的表现是:人更依赖物体整体形状,很多模型却更依赖局部纹理;人面对模糊、噪声、天气干扰等退化输入时往往还能保持相对稳定的识别,而模型常常迅速失准;再进一步,当目标只是嵌在复杂场景中的抽象形状时,人类往往能凭整体构型看出来,许多现有模型却仍然抓不住重点。论文开篇就把这些现象并列起来,指出它们并不是彼此孤立的小问题,而是共同指向一个更深层的事实:当前 AI 视觉系统学到的特征组织方式,仍与人类有明显差异。

这篇文章的思路并不沿着“再堆更大模型、更大数据”的熟路走,而是把问题转向“模型是如何长成现在这种看法的”。作者提出,人类视觉并不是从第一天起就以成人水平接收清晰、完整、色彩成熟的输入;相反,视觉清晰度、对比敏感度和颜色敏感度都经历了长期发育过程。于是,一个关键假设出现了:如果 AI 在训练时也经历一条更接近人类发育轨迹的“视觉饮食”,它是否会学到更接近人类的、以形状为基础的表征,并由此获得更强稳健性?这件事之所以重要,在于它把“学多少”之外的另一个维度——“按什么顺序、在什么感知条件下学习”——推到了台前。尤其值得注意的是,既有工作多聚焦于视觉清晰度,也常把发育过程简化成少数离散模糊阶段;而本文试图把几十年心理物理学证据整合起来,用连续曲线同时描述清晰度、对比敏感度和颜色敏感度的发展,再检验这种更完整的发育式训练,是否真的能系统改写模型的视觉偏好与鲁棒性边界。

图5

实验设计与方法逻辑

作者没有改网络结构,而是把“人类从出生到 25 岁的视觉成熟过程”映射为训练期输入图像的连续预处理课程。Figure 1 是理解全文方法逻辑的关键:视觉清晰度用高斯模糊近似,对比敏感度通过频域阈值化调制,颜色敏感度则用灰度到彩色的渐进过渡来实现,并把年龄与训练 epoch 对应起来。作者以 α、β、λ 三个超参数控制发育速度与对比敏感度轨迹,先在 mini-ecoset 上做扫描,再确定更偏形状的 DVD-S、更均衡的 DVD-B 和更保性能的 DVD-P。

图6

Figure 1 Following the developmental trajectory of visual acuity, chromatic sensitivity and contrast sensitivity from newborn to 25 years old, as an effective means of training robust AI vision systems.

图7

核心发现

发现一:DVD 显著提升形状偏置,并把部分模型推进到接近人类的区间

全文最核心的证据来自形状—纹理冲突测试。Figure 2b 直接展示了准确率与形状偏置之间的权衡:在 ecoset 上训练的 ResNet-50 基线模型 shape bias 为 0.34,而 DVD-S 达到 0.90,DVD-B 为 0.83,DVD-P 为 0.70;其中 DVD-P 的准确率还从 62.99% 略升到 65.03%。这意味着 DVD 并不是简单地用性能换“更像人”的偏好,而是提供了可调的折中带。

图8

Figure 2 Models trained with DVD close the gap to human-level shape bias.

发现二:DVD 不只改变“答题结果”,也改变了模型依赖的区域与内部表征

如果只有 cue-conflict 上的 shape bias 提升,还不能完全排除模型只是学会了某种测试技巧。Figure 4b 和 Figure 5b、5c 的价值,就在于把证据推进到“模型内部到底怎么看”。在 IllusionBench 这类复杂场景中的抽象形状识别任务上,基线 ResNet-50 的 shape recall 只有 8.71%,最佳 ViT 为 17.13%,CLIP-RN50 与 CLIP-ViT B-32 分别为 16.72% 和 15.45%;

图9

Figure 4 In-depth investigation of the emergence of shape bias in ANNs and the underlying feature selectivity

图10

Figure 5 Models trained with DVD exhibit enhanced recognition of abstract shapes hidden within complex scenes.

发现三:真正起作用的不只是“模糊训练”,而是发育顺序本身,其中对比敏感度最关键

这篇论文一个很重要的贡献,是没有把收益简单归因于“前期看得更糊”。Figure 4a 显示,DVD-B 的形状偏置在训练早期就迅速出现,并在后续阶段保持稳定;而论文还报告了时间打乱的对照实验,结果显示若将清晰度、对比敏感度和颜色敏感度的发展顺序随机打乱,效果会弱于按时间推进的原始 DVD。也就是说,顺序本身就是机制的一部分。

发现四:更“形状化”的学习路径,同时带来了自然退化与对抗攻击下的稳健性收益

论文标题中的 robust 并非附带修饰,Figure 6 是这一主张最直接的支撑。首先在高斯模糊退化下,Figure 6a 显示 DVD-B 的识别曲线下降更平缓,并更接近文中引用的人类行为数据趋势。随后扩展到 16 类常见图像退化时,Figure 6b 表明在高严重度下,DVD 的准确率对噪声、模糊和天气扰动约为基线的 2 倍,在图像质量缺陷上可达 3–4 倍。

图11

Figure 6 ANNs trained with DVD exhibit enhanced degradation robustness to image degradations and adversarial attacks

图12

归纳总结和点评

这项工作的最大价值,在于它把“训练课程”而非单纯“模型规模”提升为解释 AI 视觉偏差的重要变量:作者提出的发育视觉饮食(DVD)把视觉清晰度、对比敏感度和颜色敏感度的连续发育轨迹嵌入训练流程,在不改网络结构的前提下,让模型在形状偏置、抽象形状识别、图像退化鲁棒性和对抗鲁棒性上都明显优于标准训练基线,其中对比敏感度发育尤其被识别为关键因素。论文的说服力来自较完整的证据链:既有跨数据集、跨架构泛化,也有受控拆解和归因分析,因此它提出的不只是一个“有效技巧”,更是一种关于视觉学习路径的可检验假设。不过边界也同样清楚:DVD 是对人类视觉发育的工程化近似,而非婴幼儿真实视觉经验的精确复制;文中展示的是在所测任务和攻击设定下更接近人类、更稳健,并不意味着模型已获得全面的人类级视觉理解。

···

图13

请打分

这篇刚刚登上 Nature Machine Intelligence 的研究,是否实至名归?我们邀请您作为“云审稿人”,一同品鉴。精读全文后,欢迎在匿名投票中打分,并在评论区分享您的深度见解。

分享人:BQ

审核:PsyBrain 脑心前沿编辑部

💡 关于我们

👋 你好,这里是「PsyBrain 脑心前沿」

🧠 专注追踪全球认知神经科学的最尖端突破

🔍 视野直击 Nature, Science, Cell 正刊 及核心子刊与顶级大刊

📄 每日速递「深度解读」与「前沿快讯」

科研是一场探索未知的长跑,但你无需独行。欢迎加入 PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。

👇点击卡片进群,欢迎你的到来👇

图14

一键关注,点亮星标 ⭐ 前沿不走丢!

图15

图16

一键分享,让更多人了解前沿

预览时标签不可点

作者提示: 内容由AI生成

阅读原文

不喜欢

微信扫一扫
关注该公众号

知道了

微信扫一扫
使用小程序

取消 允许

取消 允许

取消 允许

× 分析

跳转二维码

图17

微信扫一扫可打开此内容,
使用完整服务

返回板块首页