SNN论文阅读——Towards spike-based machine intelligence with neuromorphic computing(Nature 综述)
-
人脑非凡的能力可归结于以下三个基本观察:
- 广泛的连通性
- 结构和功能化的组织层次
- 以及时间依赖(time dependent)的神经元突触连接
LIF(Leaky Integrate-and-Fire)和 HH(Hodgkin–Huxley)
基本思想
- LIF 模型
- 核心思想:把神经元当作一个电容器,接收输入电流后电压逐渐升高,电压超过阈值就放电(spike),随后重置。
- 简化了离子通道和膜电导的复杂动力学,只保留“积累—泄漏—阈值触发”三个机制。
- HH 模型
- 核心思想:从生物物理层面描述动作电位的产生过程。
- 通过离子通道(Na⁺、K⁺、泄漏通道)的电流方程,解释膜电位的动态变化。
- 是神经科学里的“黄金标准”生物真实模型。
数学形式
-
LIF(泄漏整合放电模型)
微分方程:
τmdVdt=−(V−Vrest)+R⋅I(t) \tau_m \frac{dV}{dt} = - (V - V_{rest}) + R \cdot I(t) τmdtdV=−(V−Vrest)+R⋅I(t)
其中:- VVV:膜电位
- VrestV_{rest}Vrest:静息电位
- τm\tau_mτm:膜时间常数
- R⋅I(t)R \cdot I(t)R⋅I(t):输入电流引起的电压变化
阈值条件:
if V≥Vth⇒产生脉冲并重置 V→Vreset \text{if } V \geq V_{th} \Rightarrow \text{产生脉冲并重置 } V \to V_{reset} if V≥Vth⇒产生脉冲并重置 V→Vreset
-
HH(Hodgkin–Huxley 模型)
微分方程组(耦合非线性四个方程):
CmdVdt=I(t)−(INa+IK+IL) C_m \frac{dV}{dt} = I(t) - (I_{Na} + I_{K} + I_{L}) CmdtdV=I(t)−(INa+IK+IL)
电流由离子通道决定:
INa=gˉNam3h(V−ENa),IK=gˉKn4(V−EK),IL=gL(V−EL) I_{Na} = \bar{g}_{Na} m^3 h (V - E_{Na}), \quad I_{K} = \bar{g}_{K} n^4 (V - E_{K}), \quad I_{L} = g_{L}(V - E_{L}) INa=gˉNam3h(V−ENa),IK=gˉKn4(V−EK),IL=gL(V−EL)
并有三个门控变量:- m,h,nm, h, nm,h,n:分别代表 Na⁺ 激活门、失活门,K⁺ 激活门
- 每个变量都由一阶微分方程控制(Sigmoid 型开关)
→ 数学复杂度高,4个耦合非线性微分方程。
生物机制
- LIF
- 仅有输入电流积累 + 膜电位泄漏 + 阈值触发。
- 不区分离子种类,无法解释动作电位的形状。
- 适合建模大规模网络,因为简单。
- HH
- 描述了离子通道动力学和动作电位的产生。
- 能复现 spike 的形状、折返特性、绝对不应期。
- 更接近生物真实神经元。
突触可塑性(synaptic plasticity)在不同学习规则下的对比
突触可塑性是什么?
突触可塑性 = 突触强度(权重)随时间和活动模式的变化。
它是学习和记忆的基础。
公式上一般写作:
Δwij=f(prei,postj,modulators) \Delta w_{ij} = f(\text{pre}_i, \text{post}_j, \text{modulators}) Δwij=f(prei,postj,modulators)
其中:
- wijw_{ij}wij:突触权重
- prei\text{pre}_iprei:前神经元活动
- postj\text{post}_jpostj:后神经元活动
- modulators:调制因子(如 neuromodulators, global signals 等)
Hebbian 型可塑性
基本思想
“同时激活的神经元会加强连接”。
经典表述:
Δwij∝xi⋅yj \Delta w_{ij} \propto x_i \cdot y_j Δwij∝xi⋅yj
- xix_ixi:前神经元活动
- yjy_jyj:后神经元活动
主要形式
-
纯 Hebb 学习
- 只看 pre 和 post 的相关性。
- 缺点:容易权重无限增长。
-
Oja’s Rule(归一化 Hebb)
Δwij=η(xiyj−yj2wij) \Delta w_{ij} = \eta (x_i y_j - y_j^2 w_{ij}) Δwij=η(xiyj−yj2wij)
→ 避免权重发散。 -
STDP(Spike-Timing Dependent Plasticity)
- 时间敏感型 Hebbian 学习。
- 规则:
- pre→post 短时间内:权重增强(LTP)。
- post→pre 短时间内:权重减弱(LTD)。
- 更接近生物神经元。
特点
- 局部学习:权重更新只依赖 pre/post 神经元的活动。
- 生物合理性强。
- 解释了学习和记忆的神经机制。
非 Hebbian 型可塑性
“权重变化不仅仅取决于前后神经元的相关性”。
主要类别
-
同调制可塑性(Neuromodulator-based)
-
例如 dopamine, serotonin, acetylcholine 调节权重更新。
-
公式:
Δwij∝δ⋅f(pre,post) \Delta w_{ij} \propto \delta \cdot f(\text{pre}, \text{post}) Δwij∝δ⋅f(pre,post)- δ\deltaδ:奖励信号(类似强化学习的 TD-error)。
-
-
Homeostatic Plasticity(稳态可塑性)
- 保证网络整体活动水平稳定。
- 如果神经元过度兴奋 → 降低突触强度。
- 如果神经元活动过低 → 增强突触强度。
-
Structural Plasticity(结构可塑性)
- 突触不仅能变强变弱,还能 生成或删除。
- 例如新突触的形成、修剪。
-
Heterosynaptic Plasticity(异突触可塑性)
- 一个突触的变化依赖于其他突触的活动,而不是局部 pre-post。
-
Short-term Plasticity(短时程可塑性)
- 毫秒到秒级的突触增强或抑制(如突触疲劳、突触增强)。
- 不一定符合 Hebbian。
综合理解
- Hebbian 学习 → 局部、无监督、解释“神经元如何联结”。
- 非 Hebbian 学习 → 包含调制、稳态、奖励驱动,解释“大脑如何保持稳定并实现目标导向学习”。
- 两者不是对立,而是 互补:
- Hebb 提供 相关性驱动
- 非 Hebb 提供 全局调节与约束
非 Hebbian 型突触可塑性(non-Hebbian plasticity)
- 非 Hebbian 可塑性指的是那些不只是依赖于局部 pre × post 的相关性,而是受额外因子(例如全局调制信号、稳态调节、其他突触的活动、资源可用性、结构重塑等)影响的突触变化机制。它们在生物大脑中负责稳态维持、奖励导向学习、快速短时可塑性、结构重塑等功能,在工程上用于保证学习稳定性、编码奖励、实现可塑性门控等。
三因子 / 奖励调制可塑性(Reward-modulated STDP / Three-factor rules)
-
概念与动机
Hebbian/STDP 是局部的,但许多学习任务需要目标或奖励信号(例如食物、奖励、行为得分)来指导哪些突触应该被强化。神经生理学发现如多巴胺(dopamine)能调制可塑性:奖赏出现时突触更易巩固。数学上把这个“奖励/调制信号”作为第三因子,获得“三因子学习规则”。
-
数学形式(连续 & 离散)
最常见的工程表述(事件驱动)是:
- 维护本地资格痕迹(eligibility trace) eij(t)e_{ij}(t)eij(t)(只依赖 pre/post 的短期历史);
- 当有全局奖励(或 neuromodulator 脉冲)M(t)M(t)M(t) 时,突触按资格痕迹放大/更新。
离散时间写法(在时刻 ttt):
资格痕迹递推:eij(t+1)=γe eij(t)+local_termij(t)权重更新(在或收到调制信号时):Δwij(t)=η M(t) eij(t) \begin{aligned} &\text{资格痕迹递推:}\quad e_{ij}(t+1) = \gamma_e\, e_{ij}(t) + \text{local\_term}_{ij}(t)\\[4pt] &\text{权重更新(在或收到调制信号时):}\quad \Delta w_{ij}(t) = \eta\, M(t)\, e_{ij}(t) \end{aligned} 资格痕迹递推:eij(t+1)=γeeij(t)+local_termij(t)权重更新(在或收到调制信号时):Δwij(t)=ηM(t)eij(t)
其中:- γe∈(0,1)\gamma_e \in (0,1)γe∈(0,1) 是衰减因子(时间常数 τe\tau_eτe),local_term 通常是 pre/post 的瞬时相关量(比如 Sj(t)⋅ϕ(Vi(t))S_j(t) \cdot \phi(V_i(t))Sj(t)⋅ϕ(Vi(t)) 或 Sj(t)Si(t)S_j(t)S_i(t)Sj(t)Si(t) 的某种代替),即与 STDP 的成对项类似;
- M(t)M(t)M(t) 是调制信号(例如 M(t)=R(t)−RˉM(t)=R(t)-\bar RM(t)=R(t)−Rˉ 或多巴胺脉冲),可以是标量或符号;
- η\etaη 学习率。
实现含义:资格痕迹记录“哪些突触在过去某段时间内处于可塑性候选状态(即 pre/post 成对发生过)”。当随后收到 reward(或 neuromodulator)时,才把这些候选改变为长期权重变化。
-
从概率梯度(REINFORCE)推导的直觉(简要)
把强化学习的目标 J=E[R]J=\mathbb{E}[R]J=E[R](期望奖励)对突触 www 求导,利用策略梯度思想(REINFORCE)会得到类似表达:
∂J∂w=E[R∑t∂lnp(spikes at t)∂w]≈E[R∑te(t)]. \frac{\partial J}{\partial w} = \mathbb{E}\Big[ R \sum_t \frac{\partial \ln p(\text{spikes at }t)}{\partial w} \Big] \approx \mathbb{E}\Big[R \sum_t e(t)\Big]. ∂w∂J=E[Rt∑∂w∂lnp(spikes at t)]≈E[Rt∑e(t)].
因此期望更新形式为 Δw∝E[Re]\Delta w \propto \mathbb{E}[R e]Δw∝E[Re]. 在实现上把 RRR(或 R−bR - bR−b 减去 baseline)作为 modulatory signal MMM,把 ∑t∂lnp/∂w\sum_t \partial \ln p / \partial w∑t∂lnp/∂w 用 eligibility trace 近似 -> 得三因子规则。注意:常用技巧是减去 baseline bbb(例如平均奖励)来减少方差,更新为 Δw∝(R−b)e\Delta w \propto (R - b) eΔw∝(R−b)e。
-
离散伪码(事件驱动)
# 每时间步 t: for each synapse ij: e[ij] = gamma_e * e[ij] + local_term( pre_j[t], post_i[t] ) # e.g. pre_j[t]*post_i_trace # 当 modulatory signal M[t] 到达时: for each synapse ij: w[ij] += eta * M[t] * e[ij] -
参数/时间尺度建议
- γe\gamma_eγe 取决于奖励延迟:若 reward 延迟较长,τe\tau_eτe 需更大(例如数百 ms 到 秒 级)。
- local_term 选取需与 spike 形式对应(例如对于 LIF,可用预迹 xjx_jxj 和后膜触发函数 ϕ(Vi)\phi(V_i)ϕ(Vi))。
- baseline b:可用滑动平均奖励 Rˉ\bar RRˉ。
Homeostatic / 稳态可塑性(Synaptic scaling 等)
-
概念与目的
Hebbian 增强会使某些神经元兴奋度持续提高,为防止网络崩溃或沉默,神经元/网络有慢尺度机制维持平均放电率在目标范围,这称为 homeostatic plasticity。常见生物机制包括突触尺度调节(synaptic scaling)和调节 excitability(膜通道表达)。
-
突触尺度调节(multiplicative scaling)
理想目标:保持神经元平均输出 ⟨yi⟩\langle y_i \rangle⟨yi⟩ 接近目标 ytargety_{target}ytarget,同时保留输入权重的相对比例(即 normalization but multiplicative)。
常见离散更新:
wij←wij⋅(1+ηh (ytarget⟨yi⟩−1)) w_{ij} \leftarrow w_{ij} \cdot \Big( 1 + \eta_h \, \big( \frac{y_{\text{target}}}{\langle y_i \rangle} - 1 \big) \Big) wij←wij⋅(1+ηh(⟨yi⟩ytarget−1))
或写为平滑泄减形式(连续):
dwijdt=κ (Ytarget−⟨yi⟩) wij. \frac{dw_{ij}}{dt} = \kappa \, \big(Y_{\text{target}} - \langle y_i \rangle\big)\, w_{ij}. dtdwij=κ(Ytarget−⟨yi⟩)wij.
推导/说明:- 乘性项 ×wij\times w_{ij}×wij 保持不同突触间比值不变(如果所有权重同乘以同一因子),因此保留“学习到的相对结构”但调整体增益;
- 时间尺度通常慢(小时到天),用于长期稳态。
-
归一化(additive 或 multiplicative)
另一种常见实现是按 postsynaptic 对所有输入权重做归一或投影:
- L1 归一化: ∑jwij=C\sum_j w_{ij} = C∑jwij=C
- L2 归一化或投影至单位范数
这些约束在实践中常与 Hebb 或 STDP 联合使用,防止 runaway。
-
伪码(周期性更新)
# 每 T_homeo 秒: for each post neuron i: r_i = estimate_mean_firing_rate(i) factor = y_target / (r_i + eps) for each presyn j: w[i,j] *= factor**alpha # alpha \in (0,1) 学习率
Heterosynaptic plasticity(异突触可塑性)
-
概念
当一个突触发生 LTP/LTD 时,其他(可能未活跃的)突触也出现补偿性改变;这是“非局部”的可塑性,常被视为一种局部 homeostasis 或竞争机制。
-
简单数学模型
一种简化形式:
Δwik=Hebbian_termik−β∑j≠kHebbian_termij \Delta w_{ik} = \text{Hebbian\_term}_{ik} - \beta \sum_{j\ne k} \text{Hebbian\_term}_{ij} Δwik=Hebbian_termik−βj=k∑Hebbian_termij
或
Δwik∝Hebbik−β Hebb‾i \Delta w_{ik} \propto \text{Hebb}_{ik} - \beta \, \overline{\text{Hebb}}_i Δwik∝Hebbik−βHebbi
其中 Hebb‾_i\overline{\text{Hebb}}\_iHebb_i 是 postsynaptic i 对所有输入的平均 Hebbian 驱动,β\betaβ 控制补偿强度。
这样做能在局部保持总输入大小相对稳定,并引入竞争(强的突触加强会导致其他突触减弱)。
-
作用
- 防止少数突触无限制增强
- 引入稀疏性和竞争性表示
短时可塑性(STP,Tsodyks–Markram 模型)
-
概念
STP 发生在 ms–s 时间尺度:突触响应对短期历史敏感,表现为 短暂增益(facilitation) 或 突触疲劳/抑制(depression)。它不是长期权重改变,而是瞬时的可用资源或利用率变化,影响瞬时突触传递。
-
常用模型(Tsodyks–Markram)
变量:
- R(t)R(t)R(t):可用资源比例(0…1)
- u(t)u(t)u(t):每次 spike 时利用率(release probability 的动态量)
参数:
- UUU:基线利用率增量参数
- τ_D\tau\_{D}τ_D:恢复(depression)时间常数
- τ_F\tau\_{F}τ_F:促进恢复时间常数
离散事件驱动更新(在 presynaptic spike 时刻):
u←u+U(1−u)x←x(1−u)(这里 x 等同于 R)PSC (amplitude)∝A u x \begin{aligned} u &\leftarrow u + U(1-u) \\ x &\leftarrow x (1 - u) \quad\text{(这里 x 等同于 R)}\\ \text{PSC (amplitude)} &\propto A\, u\, x \end{aligned} uxPSC (amplitude)←u+U(1−u)←x(1−u)(这里 x 等同于 R)∝Aux
连续衰减(未发 spike 时):
dudt=−uτF,dxdt=1−xτD. \frac{du}{dt} = -\frac{u}{\tau_F},\qquad \frac{dx}{dt} = \frac{1-x}{\tau_D}. dtdu=−τFu,dtdx=τD1−x.
(记法上有多种变体,x 或 R 表示可用量。)
-
稳态对 Poisson 输入的解析—简要
对于恒定 Poisson 率 rrr,稳态值可求解(略去推导细节):有效突触平均传递率约为
efficacy∝U1+r τD U(若以 depression 主导) \text{efficacy} \propto \frac{U}{1 + r \, \tau_D \, U} \quad\text{(若以 depression 主导)} efficacy∝1+rτDUU(若以 depression 主导)
意义:高频输入会使突触抑制(降低响应),低频输入维持高应答(或相反对 facilitation)。这给突触带来频率选择性。
-
伪码(事件驱动)
# on presyn spike at time t: u = u + U * (1 - u) x = x * (1 - u) psc = A * u * x # between spikes: u *= exp(-dt/tau_F); x += (1-x)*(1-exp(-dt/tau_D))
结构可塑性(Synaptogenesis / Pruning)
-
概念
长期尺度(天–周):神经元可以新建/修剪树突或轴突上的突触。模型通常是随机的 birth-death 过程但受活动驱动调节。
-
简单模型
-
每一对 neuron (i,j) 有存在概率 p_ij(t)p\_{ij}(t)p_ij(t);更新规则可能是:
dpijdt=α⋅F(activityi,j)−β⋅pij \frac{dp_{ij}}{dt} = \alpha \cdot F(\text{activity}_{i,j}) - \beta \cdot p_{ij} dtdpij=α⋅F(activityi,j)−β⋅pij
-
当 p_ijp\_{ij}p_ij 越过阈值时形成突触;低于阈值则修剪。
用途:网络可以重构连通性以适应长期统计、节省代价、维持效率。
-
元可塑性(Metaplasticity)与 BCM 规则
-
概念
元可塑性指可塑性机制本身可以随历史被调节(例如阈值滑动)。
BCM(Bienenstock-Cooper-Munro)是一个经典模型:权重更新与输出 yyy 的差于滑动阈值 θ\thetaθ 有关:
Δw∝xy(y−θ), \Delta w \propto x y (y - \theta), Δw∝xy(y−θ),并且阈值滑动为(平均平方活动):
τθdθdt=y2−θ. \tau_\theta \frac{d\theta}{dt} = y^2 - \theta. τθdtdθ=y2−θ.
含义:当输出小于阈值 (y<θy < \thetay<θ) 时 LTD(削弱),当 y>θy>\thetay>θ 时 LTP(加强);阈值随历史活动上升,提供 homeostasis。
-
数学效果
- 在稳态下 θ≈E[y2]\theta \approx \mathbb{E}[y^2]θ≈E[y2],从而规则会稳定网络整体活性并对频率敏感。
更多推荐


所有评论(0)