X020 Nat Mach Intell |按人类“视觉发育食谱”训练AI,真的能让模型更像人类看世界吗?
来源:公众号 PSY-Brain_Frontier | 发布:2026-04-30 | 原文链接

认知神经科学前沿文献分享

基本信息
Title: Adopting a human developmental visual diet yields robust and shape-based AI vision
发表时间: 2024.4.24
发表期刊:Nature Machine Intelligence
获取原文:
-
添加小助手: PSY-Brain-Frontier 即可获取PDF版本
-
点击页面底部“阅读原文”跳转论文网页


引言
这些年,人工智能视觉系统在规模、参数量和训练数据上一路扩张,但它与人类视觉之间的“错位”并没有因此自动消失。一个最典型的表现是:人更依赖物体整体形状,很多模型却更依赖局部纹理;人面对模糊、噪声、天气干扰等退化输入时往往还能保持相对稳定的识别,而模型常常迅速失准;再进一步,当目标只是嵌在复杂场景中的抽象形状时,人类往往能凭整体构型看出来,许多现有模型却仍然抓不住重点。论文开篇就把这些现象并列起来,指出它们并不是彼此孤立的小问题,而是共同指向一个更深层的事实:当前 AI 视觉系统学到的特征组织方式,仍与人类有明显差异。
这篇文章的思路并不沿着“再堆更大模型、更大数据”的熟路走,而是把问题转向“模型是如何长成现在这种看法的”。作者提出,人类视觉并不是从第一天起就以成人水平接收清晰、完整、色彩成熟的输入;相反,视觉清晰度、对比敏感度和颜色敏感度都经历了长期发育过程。于是,一个关键假设出现了:如果 AI 在训练时也经历一条更接近人类发育轨迹的“视觉饮食”,它是否会学到更接近人类的、以形状为基础的表征,并由此获得更强稳健性?这件事之所以重要,在于它把“学多少”之外的另一个维度——“按什么顺序、在什么感知条件下学习”——推到了台前。尤其值得注意的是,既有工作多聚焦于视觉清晰度,也常把发育过程简化成少数离散模糊阶段;而本文试图把几十年心理物理学证据整合起来,用连续曲线同时描述清晰度、对比敏感度和颜色敏感度的发展,再检验这种更完整的发育式训练,是否真的能系统改写模型的视觉偏好与鲁棒性边界。

实验设计与方法逻辑
作者没有改网络结构,而是把“人类从出生到 25 岁的视觉成熟过程”映射为训练期输入图像的连续预处理课程。Figure 1 是理解全文方法逻辑的关键:视觉清晰度用高斯模糊近似,对比敏感度通过频域阈值化调制,颜色敏感度则用灰度到彩色的渐进过渡来实现,并把年龄与训练 epoch 对应起来。作者以 α、β、λ 三个超参数控制发育速度与对比敏感度轨迹,先在 mini-ecoset 上做扫描,再确定更偏形状的 DVD-S、更均衡的 DVD-B 和更保性能的 DVD-P。

Figure 1 Following the developmental trajectory of visual acuity, chromatic sensitivity and contrast sensitivity from newborn to 25 years old, as an effective means of training robust AI vision systems.

核心发现
发现一:DVD 显著提升形状偏置,并把部分模型推进到接近人类的区间
全文最核心的证据来自形状—纹理冲突测试。Figure 2b 直接展示了准确率与形状偏置之间的权衡:在 ecoset 上训练的 ResNet-50 基线模型 shape bias 为 0.34,而 DVD-S 达到 0.90,DVD-B 为 0.83,DVD-P 为 0.70;其中 DVD-P 的准确率还从 62.99% 略升到 65.03%。这意味着 DVD 并不是简单地用性能换“更像人”的偏好,而是提供了可调的折中带。

Figure 2 Models trained with DVD close the gap to human-level shape bias.
发现二:DVD 不只改变“答题结果”,也改变了模型依赖的区域与内部表征
如果只有 cue-conflict 上的 shape bias 提升,还不能完全排除模型只是学会了某种测试技巧。Figure 4b 和 Figure 5b、5c 的价值,就在于把证据推进到“模型内部到底怎么看”。在 IllusionBench 这类复杂场景中的抽象形状识别任务上,基线 ResNet-50 的 shape recall 只有 8.71%,最佳 ViT 为 17.13%,CLIP-RN50 与 CLIP-ViT B-32 分别为 16.72% 和 15.45%;

Figure 4 In-depth investigation of the emergence of shape bias in ANNs and the underlying feature selectivity

Figure 5 Models trained with DVD exhibit enhanced recognition of abstract shapes hidden within complex scenes.
发现三:真正起作用的不只是“模糊训练”,而是发育顺序本身,其中对比敏感度最关键
这篇论文一个很重要的贡献,是没有把收益简单归因于“前期看得更糊”。Figure 4a 显示,DVD-B 的形状偏置在训练早期就迅速出现,并在后续阶段保持稳定;而论文还报告了时间打乱的对照实验,结果显示若将清晰度、对比敏感度和颜色敏感度的发展顺序随机打乱,效果会弱于按时间推进的原始 DVD。也就是说,顺序本身就是机制的一部分。
发现四:更“形状化”的学习路径,同时带来了自然退化与对抗攻击下的稳健性收益
论文标题中的 robust 并非附带修饰,Figure 6 是这一主张最直接的支撑。首先在高斯模糊退化下,Figure 6a 显示 DVD-B 的识别曲线下降更平缓,并更接近文中引用的人类行为数据趋势。随后扩展到 16 类常见图像退化时,Figure 6b 表明在高严重度下,DVD 的准确率对噪声、模糊和天气扰动约为基线的 2 倍,在图像质量缺陷上可达 3–4 倍。

Figure 6 ANNs trained with DVD exhibit enhanced degradation robustness to image degradations and adversarial attacks

归纳总结和点评
这项工作的最大价值,在于它把“训练课程”而非单纯“模型规模”提升为解释 AI 视觉偏差的重要变量:作者提出的发育视觉饮食(DVD)把视觉清晰度、对比敏感度和颜色敏感度的连续发育轨迹嵌入训练流程,在不改网络结构的前提下,让模型在形状偏置、抽象形状识别、图像退化鲁棒性和对抗鲁棒性上都明显优于标准训练基线,其中对比敏感度发育尤其被识别为关键因素。论文的说服力来自较完整的证据链:既有跨数据集、跨架构泛化,也有受控拆解和归因分析,因此它提出的不只是一个“有效技巧”,更是一种关于视觉学习路径的可检验假设。不过边界也同样清楚:DVD 是对人类视觉发育的工程化近似,而非婴幼儿真实视觉经验的精确复制;文中展示的是在所测任务和攻击设定下更接近人类、更稳健,并不意味着模型已获得全面的人类级视觉理解。
···

请打分
这篇刚刚登上 Nature Machine Intelligence 的研究,是否实至名归?我们邀请您作为“云审稿人”,一同品鉴。精读全文后,欢迎在匿名投票中打分,并在评论区分享您的深度见解。
分享人:BQ
审核:PsyBrain 脑心前沿编辑部
💡 关于我们
👋 你好,这里是「PsyBrain 脑心前沿」
🧠 专注追踪全球认知神经科学的最尖端突破
🔍 视野直击 Nature, Science, Cell 正刊 及核心子刊与顶级大刊
📄 每日速递「深度解读」与「前沿快讯」
科研是一场探索未知的长跑,但你无需独行。欢迎加入 PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。
👇点击卡片进群,欢迎你的到来👇
一键关注,点亮星标 ⭐ 前沿不走丢!


一键分享,让更多人了解前沿
预览时标签不可点
作者提示: 内容由AI生成
阅读原文
不喜欢
微信扫一扫
关注该公众号
知道了
微信扫一扫
使用小程序
取消 允许
取消 允许
取消 允许
× 分析

微信扫一扫可打开此内容,
使用完整服务
