# ResNet：用于图像识别的深度残差学习

本文解析《Deep Residual Learning for Image Recognition》，即用于图像识别的深度残差学习论文。

Source: https://www.iplexlaw.co.kr/zh/blog/876621

首页 / 新闻与洞见 新闻与洞见 ResNet：用于图像识别的深度残差学习 本文解析《Deep Residual Learning for Image Recognition》，即用于图像识别的深度残差学习论文。 人工智能与软件 2023.07.03 已发布 IPLEX 阅读约5分钟 本文解析《Deep Residual Learning for Image Recognition》，即用于图像识别的深度残差学习论文。 ( 跳转至正文 ) 论文在2016年CVPR发表,并引起了很多人的注意. 这是因为ResNet,这是本文中在Imagenet竞赛中提出的. 本文的主要特点是利用剩余学习来加深网络. 该理论认为网络越深,从数据中可以提取的特征越丰富,性能越高. 然而,在一个典型的网络中,问题在于层实际上变得太深,而不是性能. 本条采用留守学习方法改进了这些问题. [背景] 在一个革命神经网络(CNN)中,每个不同的滤波器都通过输入对某一层进行革命操作,并从输出中提取激活图. 在这里,每个多滤波器都经过训练,可以提取不同的特征值. 例如,假设您有一个包含三个通道的输入值. 如果使用总共5个滤波器(将5个滤波器各滑入3个输入通道进行转录操作)进行转录操作,则从输出层中抽出5个激活图(每个包含不同的特征信息). 这相当于过滤器的数量,其中激活图的宽度和高度小于输入值的宽度和高度. 因此,层层越深,输出层的通道越多,宽度和高度越小. 这是一种常见的现象,即如果在执行转录操作时没有粘贴在输入层上,高度和宽度就会降低. 同时,在ResNet之前就已经赢得了Imagenet的VGG网络使用了很多小尺寸的滤波器(3*3 convolution filter),这提高了层的深度以表现良好. VGG网络 这些VGG网络的缺点是增加了参数的数量,但它们利用了演化层. 虽然许多网络使用它作为骨干网络, 由于参数很多,还需要加以固定。 Resnet来解决这些问题. [本条的主要意 一般说来,层层越深,模型的学习难度越高,所以不易如意地优化. 简单地建立一个基于VGG网络的革命神经网络,是本文中一个关键的想法,即利用剩余块使学习发挥作用,因为学习是不可能的. 在此,剩余块执行一个功能,降低一个网络优化的难度. 在本文中,我们指出,实际学习的内置绘图是H(x),并争论说,立即学习是困难的. 因此,有人争辩说,通过重新定义为F(x)=H(x)-x的绘图,学习F(x)而不是H(x)比较困难. * * * * * 更具体地说,当x被输入到一个重层,如一个演化层时,特征被提取,特征会经历一个激活功能,如relu. 网络配置时,整个网络执行非线性操作. 然后,网络被配置成一个连续演化层的形式. 由于每个重量层在这里是分开的,所以有必要为每个重量层分别学习所有重量值. 然后,强度会增加。 这层越深,情况就越糟糕。 因此,很难学习到一个功能H(x)是理想的. * * * * * 本文提出了使用H(x)作为F(x)函数的核心思想,F(x)是一种较为精通的学习形式. 这里没有特定的改变,只有输入值(x)加入到限定值(F(x))的多层中. 这里。 F(x)+x要从上层学习到的信息(x),通过学习附加信息F(x),加入到其中. 我是认真的。 也就是说,X 若按原样处理,则取尚需学习的剩余信息,F(x)+x. (这是H(x)) 这比教书容易得多。 通过这样改变网络,学习可以更快,更高的性能. 如果我们更详细地审视数学公式,我们首先可以定义F(x)函数如下: 当输入值x出现时,将其乘以第一个重值(W1),写出激活引信(relu),并将结果乘以第二个重值(W2). F( x) 函数就是这样定义的 。 我们在这里加X。 最终值可通过以下形式表示. 如果看这个公式,可以看到重量值可以被多次使用,而不只是两次. 这被称为多层演化层. 此外,我们可以使用快捷连接来导入已有的输入值,并把它们添加到多个演化层中. 在这里,Ws通过线性投影,实现将输入维度与多个演化层的输出维度相匹配的功能. 查看韩文原文 本文基于发表时的情况撰写。如需就具体事项咨询，请联系IPLEX。 咨询相关业务 ↗ 全部文章 咨询IPLEX 与我们讨论您的需求 保护、维权与管理。 我们将与您共同分析技术与业务需求。 ↗ 联系我们 较新文章 StarGAN论文解析 ↗ 较早文章 提升深度学习性能：Mixup训练与标签平滑 ↗ 相关解读 人工智能与软件 2026.10.01 FiX：在softmax注意力中实现细粒度遗忘 金容德专利代理师解析FiX的逐特征门控、数值计算与分页缓存，并区分论文已报告的效果和仍待验证的局限。 ↗ 阅读全文 人工智能与软件 2026.09.30 MHAR：让不同特征子空间分别读取历史层信息 韩国专利代理师金容德分析Multi-Head Attention Residuals的深度路由、实验结果、实现成本及技术特征与效果之间的关系。 ↗ 阅读全文 人工智能与软件 2026.09.28 专栏发表：从Claude Computer Use看AI智能体的训练数据与专利技术 IPLEX管理合伙人、专利代理师金容德在AI Times发表专栏，结合美国第12,585,862号专利，解析AI智能体学习操作计算机的技术路径。 ↗ 阅读全文

- https://www.iplexlaw.co.kr/zh
- https://www.iplexlaw.co.kr/zh/blog/category/ai
- https://arxiv.org/pdf/1512.03385.pdf
- https://www.iplexlaw.co.kr/forum/view/876621
- https://www.iplexlaw.co.kr/zh/contact
- https://www.iplexlaw.co.kr/zh/blog
- https://www.iplexlaw.co.kr/zh/contact
- https://www.iplexlaw.co.kr/zh/blog/878875
- https://www.iplexlaw.co.kr/zh/blog/875313
- https://www.iplexlaw.co.kr/zh/blog/fix-fine-grained-forgetting-attention
- https://www.iplexlaw.co.kr/zh/blog/fix-fine-grained-forgetting-attention
- https://www.iplexlaw.co.kr/zh/blog/mhar-multi-head-attention-residuals
- https://www.iplexlaw.co.kr/zh/blog/mhar-multi-head-attention-residuals
- https://www.iplexlaw.co.kr/zh/blog/claude-computer-use-agent-patent
- https://www.iplexlaw.co.kr/zh/blog/claude-computer-use-agent-patent
