<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Deep Learning on 📝Mocong's Blogs</title><link>https://taffyboys.github.io/tags/deep-learning/</link><description>Recent content in Deep Learning on 📝Mocong's Blogs</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Mon, 13 Jul 2026 14:46:00 +0800</lastBuildDate><atom:link href="https://taffyboys.github.io/tags/deep-learning/index.xml" rel="self" type="application/rss+xml"/><item><title>5.1 Exercises</title><link>https://taffyboys.github.io/posts/5.1_exercises/</link><pubDate>Mon, 13 Jul 2026 14:46:00 +0800</pubDate><guid>https://taffyboys.github.io/posts/5.1_exercises/</guid><description>&lt;ol&gt;
&lt;li&gt;Show that adding layers to a &lt;em&gt;linear&lt;/em&gt; deep network, i.e., a network without nonlinearity can never increase the expressive power of the network. Give an example where it actively reduces it.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;strong&gt;线性网络（无激活）：矩阵乘法必然坍缩&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;多层线性网络等价于一个线性变换：&lt;br&gt;
\(\mathbf{y} = \mathbf{W}_L \cdots \mathbf{W}_1 \mathbf{x} = \mathbf{W}_{\text{eff}} \mathbf{x}\)&lt;/li&gt;
&lt;li&gt;有效权重矩阵的秩受瓶颈限制：&lt;br&gt;
\(\text{rank}(\mathbf{W}_{\text{eff}}) \le \min\limits_i \text{rank}(\mathbf{W}_i)\)&lt;/li&gt;
&lt;li&gt;如果中间层宽度小于输入/输出维度，信息被永久压缩，无法恢复（例如无法表达满秩映射）。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;非线性网络（有激活）：逐元素操作破坏线性相关性&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;线性部分的输出经过非线性函数（如 ReLU）：&lt;br&gt;
\(\mathbf{h}_{i+1} = \text{ReLU}(\mathbf{W}_{i+1} \mathbf{h}_i)\)&lt;/li&gt;
&lt;li&gt;ReLU 会将所有负值归零，这一“剪切”操作&lt;strong&gt;破坏了矩阵行/列之间的线性相关性&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;原本线性相关的行（成比例）经过不同的截断后，变得&lt;strong&gt;不再成比例&lt;/strong&gt;，因此矩阵的秩在非线性层之后显著增加，逼近该层的维度上限。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;本质对比&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th style="text-align: left"&gt;网络类型&lt;/th&gt;
					&lt;th style="text-align: left"&gt;数学本质&lt;/th&gt;
					&lt;th style="text-align: left"&gt;对秩的影响&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;线性深度网络&lt;/td&gt;
					&lt;td style="text-align: left"&gt;矩阵乘积&lt;/td&gt;
					&lt;td style="text-align: left"&gt;秩单调不增，受瓶颈限制&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;非线性深度网络&lt;/td&gt;
					&lt;td style="text-align: left"&gt;复合非线性函数&lt;/td&gt;
					&lt;td style="text-align: left"&gt;每层非线性可恢复/提升秩，打破瓶颈&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;hr&gt;
&lt;ol start="2"&gt;
&lt;li&gt;Compute the derivative of the pReLU activation function.&lt;/li&gt;
&lt;/ol&gt;
\[
\frac{d}{dx} \text{PReLU}(x) =
\begin{cases}
1 &amp; \text{if } x &gt; 0 \\
\alpha &amp; \text{if } x &lt; 0 \\
未定义（实践中取\alpha或1） &amp; \text{if } x = 0
\end{cases}
\]&lt;hr&gt;
&lt;ol start="3"&gt;
&lt;li&gt;Compute the derivative of the Swish activation function
\[ x\ sigmoid(\beta x) \].&lt;/li&gt;
&lt;/ol&gt;
\[
\frac{d}{dx} \text{Swish}(x) = \sigma(\beta x) + \beta x \cdot \sigma(\beta x) \cdot (1 - \sigma(\beta x))
\]&lt;hr&gt;
&lt;ol start="4"&gt;
&lt;li&gt;Show that an MLP using only ReLU (or pReLU) constructs a continuous piecewise linear function.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;设 \( f \) 是连续分段线性函数，其线性区域集合为 \(\{\mathcal{R}_i\}_{i=1}^m\)，每个区域为凸多面体。&lt;/p&gt;</description></item><item><title>ReLU如何缓解梯度消失</title><link>https://taffyboys.github.io/posts/relu_vanishing_gradient/</link><pubDate>Mon, 13 Jul 2026 00:00:00 +0000</pubDate><guid>https://taffyboys.github.io/posts/relu_vanishing_gradient/</guid><description>&lt;h2 id="1-背景梯度消失的本质"&gt;1. 背景：梯度消失的本质&lt;/h2&gt;
&lt;p&gt;在深度神经网络中，梯度消失（Vanishing Gradient）是指&lt;strong&gt;反向传播时，越靠近输入层的梯度越小，甚至趋近于零&lt;/strong&gt;，导致浅层参数几乎无法更新，网络难以训练。&lt;/p&gt;
&lt;p&gt;其数学根源是 &lt;strong&gt;链式法则&lt;/strong&gt; 下的连乘效应：&lt;/p&gt;
\[
\frac{\partial L}{\partial W^{(l)}} = \frac{\partial L}{\partial y^{(L)}} \cdot \prod_{k=l}^{L-1} \left( W^{(k+1)} \cdot f'(z^{(k)}) \right)
\]&lt;p&gt;其中 \( f' \) 是激活函数的导数。如果每一层都乘以一个小于 1 的数，连乘结果会指数级衰减。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="2-传统激活函数的饱和问题"&gt;2. 传统激活函数的&amp;quot;饱和&amp;quot;问题&lt;/h2&gt;
&lt;h3 id="sigmoid"&gt;Sigmoid&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;导数范围：\((0, 0.25]\)&lt;/li&gt;
&lt;li&gt;在两端（极大/极小输入）导数趋近于 0&lt;/li&gt;
&lt;li&gt;深层网络中，梯度被逐层压缩到原来的 1/4 以下&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="tanh"&gt;Tanh&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;导数范围：\((0, 1]\)&lt;/li&gt;
&lt;li&gt;仅在 0 附近导数为 1，两端迅速饱和&lt;/li&gt;
&lt;li&gt;虽然比 Sigmoid 稍好，但仍存在严重衰减&lt;/li&gt;
&lt;/ul&gt;
&lt;blockquote&gt;
&lt;p&gt;这两者的共同点是：&lt;strong&gt;处处都可能饱和&lt;/strong&gt;，且导数最大值 ≤ 1。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="3-relu-的数学特性"&gt;3. ReLU 的数学特性&lt;/h2&gt;
&lt;p&gt;ReLU 定义：&lt;/p&gt;
\[
f(x) = \max(0, x)
\]&lt;p&gt;其导数极其简单：&lt;/p&gt;
\[
f'(x) = 
\begin{cases} 
1 &amp; x &gt; 0 \\
0 &amp; x &lt; 0 
\end{cases}
\]&lt;p&gt;关键点在于：&lt;/p&gt;</description></item></channel></rss>