• 人脑非凡的能力可归结于以下三个基本观察:

    • 广泛的连通性
    • 结构和功能化的组织层次
    • 以及时间依赖(time dependent)的神经元突触连接

LIF(Leaky Integrate-and-Fire)和 HH(Hodgkin–Huxley)

基本思想
  • LIF 模型
    • 核心思想:把神经元当作一个电容器,接收输入电流后电压逐渐升高,电压超过阈值就放电(spike),随后重置。
    • 简化了离子通道和膜电导的复杂动力学,只保留“积累—泄漏—阈值触发”三个机制。
  • HH 模型
    • 核心思想:从生物物理层面描述动作电位的产生过程。
    • 通过离子通道(Na⁺、K⁺、泄漏通道)的电流方程,解释膜电位的动态变化。
    • 是神经科学里的“黄金标准”生物真实模型。
数学形式
  • LIF(泄漏整合放电模型)

    微分方程:
    τmdVdt=−(V−Vrest)+R⋅I(t) \tau_m \frac{dV}{dt} = - (V - V_{rest}) + R \cdot I(t) τmdtdV=(VVrest)+RI(t)
    其中:

    • VVV:膜电位
    • VrestV_{rest}Vrest:静息电位
    • τm\tau_mτm:膜时间常数
    • R⋅I(t)R \cdot I(t)RI(t):输入电流引起的电压变化

    阈值条件:
    if V≥Vth⇒产生脉冲并重置 V→Vreset \text{if } V \geq V_{th} \Rightarrow \text{产生脉冲并重置 } V \to V_{reset} if VVth产生脉冲并重置 VVreset


  • HH(Hodgkin–Huxley 模型)

    微分方程组(耦合非线性四个方程):
    CmdVdt=I(t)−(INa+IK+IL) C_m \frac{dV}{dt} = I(t) - (I_{Na} + I_{K} + I_{L}) CmdtdV=I(t)(INa+IK+IL)
    电流由离子通道决定:
    INa=gˉNam3h(V−ENa),IK=gˉKn4(V−EK),IL=gL(V−EL) I_{Na} = \bar{g}_{Na} m^3 h (V - E_{Na}), \quad I_{K} = \bar{g}_{K} n^4 (V - E_{K}), \quad I_{L} = g_{L}(V - E_{L}) INa=gˉNam3h(VENa),IK=gˉKn4(VEK),IL=gL(VEL)
    并有三个门控变量:

    • m,h,nm, h, nm,h,n:分别代表 Na⁺ 激活门、失活门,K⁺ 激活门
    • 每个变量都由一阶微分方程控制(Sigmoid 型开关)

    → 数学复杂度高,4个耦合非线性微分方程。

生物机制
  • LIF
    • 仅有输入电流积累 + 膜电位泄漏 + 阈值触发。
    • 不区分离子种类,无法解释动作电位的形状。
    • 适合建模大规模网络,因为简单。
  • HH
    • 描述了离子通道动力学和动作电位的产生。
    • 能复现 spike 的形状、折返特性、绝对不应期。
    • 更接近生物真实神经元。

突触可塑性(synaptic plasticity)在不同学习规则下的对比

突触可塑性是什么

突触可塑性 = 突触强度(权重)随时间和活动模式的变化。
它是学习和记忆的基础。

公式上一般写作:
Δwij=f(prei,postj,modulators) \Delta w_{ij} = f(\text{pre}_i, \text{post}_j, \text{modulators}) Δwij=f(prei,postj,modulators)
其中:

  • wijw_{ij}wij:突触权重
  • prei\text{pre}_iprei:前神经元活动
  • postj\text{post}_jpostj:后神经元活动
  • modulators:调制因子(如 neuromodulators, global signals 等)
Hebbian 型可塑性

基本思想

同时激活的神经元会加强连接”。
经典表述:
Δwij∝xi⋅yj \Delta w_{ij} \propto x_i \cdot y_j Δwijxiyj

  • xix_ixi:前神经元活动
  • yjy_jyj:后神经元活动

主要形式

  1. 纯 Hebb 学习

    • 只看 pre 和 post 的相关性。
    • 缺点:容易权重无限增长。
  2. Oja’s Rule(归一化 Hebb)
    Δwij=η(xiyj−yj2wij) \Delta w_{ij} = \eta (x_i y_j - y_j^2 w_{ij}) Δwij=η(xiyjyj2wij)
    → 避免权重发散。

  3. STDP(Spike-Timing Dependent Plasticity)

    • 时间敏感型 Hebbian 学习。
    • 规则:
      • pre→post 短时间内:权重增强(LTP)。
      • post→pre 短时间内:权重减弱(LTD)。
    • 更接近生物神经元。

特点

  • 局部学习:权重更新只依赖 pre/post 神经元的活动。
  • 生物合理性强。
  • 解释了学习和记忆的神经机制。
非 Hebbian 型可塑性

“权重变化不仅仅取决于前后神经元的相关性”。

主要类别

  1. 同调制可塑性(Neuromodulator-based)

    • 例如 dopamine, serotonin, acetylcholine 调节权重更新。

    • 公式:
      Δwij∝δ⋅f(pre,post) \Delta w_{ij} \propto \delta \cdot f(\text{pre}, \text{post}) Δwijδf(pre,post)

      • δ\deltaδ:奖励信号(类似强化学习的 TD-error)。
  2. Homeostatic Plasticity(稳态可塑性)

    • 保证网络整体活动水平稳定。
    • 如果神经元过度兴奋 → 降低突触强度。
    • 如果神经元活动过低 → 增强突触强度。
  3. Structural Plasticity(结构可塑性)

    • 突触不仅能变强变弱,还能 生成或删除
    • 例如新突触的形成、修剪。
  4. Heterosynaptic Plasticity(异突触可塑性)

    • 一个突触的变化依赖于其他突触的活动,而不是局部 pre-post。
  5. Short-term Plasticity(短时程可塑性)

    • 毫秒到秒级的突触增强或抑制(如突触疲劳、突触增强)。
    • 不一定符合 Hebbian。
综合理解
  • Hebbian 学习 → 局部、无监督、解释“神经元如何联结”。
  • 非 Hebbian 学习 → 包含调制、稳态、奖励驱动,解释“大脑如何保持稳定并实现目标导向学习”。
  • 两者不是对立,而是 互补
    • Hebb 提供 相关性驱动
    • 非 Hebb 提供 全局调节与约束

非 Hebbian 型突触可塑性(non-Hebbian plasticity)

  • 非 Hebbian 可塑性指的是那些不只是依赖于局部 pre × post 的相关性,而是受额外因子(例如全局调制信号、稳态调节、其他突触的活动、资源可用性、结构重塑等)影响的突触变化机制。它们在生物大脑中负责稳态维持、奖励导向学习、快速短时可塑性、结构重塑等功能,在工程上用于保证学习稳定性、编码奖励、实现可塑性门控等。
三因子 / 奖励调制可塑性(Reward-modulated STDP / Three-factor rules)
  • 概念与动机

    Hebbian/STDP 是局部的,但许多学习任务需要目标或奖励信号(例如食物、奖励、行为得分)来指导哪些突触应该被强化。神经生理学发现如多巴胺(dopamine)能调制可塑性:奖赏出现时突触更易巩固。数学上把这个“奖励/调制信号”作为第三因子,获得“三因子学习规则”。

  • 数学形式(连续 & 离散)

    最常见的工程表述(事件驱动)是:

    • 维护本地资格痕迹(eligibility trace) eij(t)e_{ij}(t)eij(t)(只依赖 pre/post 的短期历史);
    • 当有全局奖励(或 neuromodulator 脉冲)M(t)M(t)M(t) 时,突触按资格痕迹放大/更新。

    离散时间写法(在时刻 ttt):
    资格痕迹递推:eij(t+1)=γe eij(t)+local_termij(t)权重更新(在或收到调制信号时):Δwij(t)=η M(t) eij(t) \begin{aligned} &\text{资格痕迹递推:}\quad e_{ij}(t+1) = \gamma_e\, e_{ij}(t) + \text{local\_term}_{ij}(t)\\[4pt] &\text{权重更新(在或收到调制信号时):}\quad \Delta w_{ij}(t) = \eta\, M(t)\, e_{ij}(t) \end{aligned} 资格痕迹递推:eij(t+1)=γeeij(t)+local_termij(t)权重更新(在或收到调制信号时):Δwij(t)=ηM(t)eij(t)
    其中:

    • γe∈(0,1)\gamma_e \in (0,1)γe(0,1) 是衰减因子(时间常数 τe\tau_eτe),local_term 通常是 pre/post 的瞬时相关量(比如 Sj(t)⋅ϕ(Vi(t))S_j(t) \cdot \phi(V_i(t))Sj(t)ϕ(Vi(t))Sj(t)Si(t)S_j(t)S_i(t)Sj(t)Si(t) 的某种代替),即与 STDP 的成对项类似;
    • M(t)M(t)M(t) 是调制信号(例如 M(t)=R(t)−RˉM(t)=R(t)-\bar RM(t)=R(t)Rˉ 或多巴胺脉冲),可以是标量或符号;
    • η\etaη 学习率。

    实现含义:资格痕迹记录“哪些突触在过去某段时间内处于可塑性候选状态(即 pre/post 成对发生过)”。当随后收到 reward(或 neuromodulator)时,才把这些候选改变为长期权重变化。

  • 从概率梯度(REINFORCE)推导的直觉(简要)

    把强化学习的目标 J=E[R]J=\mathbb{E}[R]J=E[R](期望奖励)对突触 www 求导,利用策略梯度思想(REINFORCE)会得到类似表达:
    ∂J∂w=E[R∑t∂ln⁡p(spikes at t)∂w]≈E[R∑te(t)]. \frac{\partial J}{\partial w} = \mathbb{E}\Big[ R \sum_t \frac{\partial \ln p(\text{spikes at }t)}{\partial w} \Big] \approx \mathbb{E}\Big[R \sum_t e(t)\Big]. wJ=E[Rtwlnp(spikes at t)]E[Rte(t)].
    因此期望更新形式为 Δw∝E[Re]\Delta w \propto \mathbb{E}[R e]ΔwE[Re]. 在实现上把 RRR(或 R−bR - bRb 减去 baseline)作为 modulatory signal MMM,把 ∑t∂ln⁡p/∂w\sum_t \partial \ln p / \partial wtlnp/w 用 eligibility trace 近似 -> 得三因子规则。

    注意:常用技巧是减去 baseline bbb(例如平均奖励)来减少方差,更新为 Δw∝(R−b)e\Delta w \propto (R - b) eΔw(Rb)e

  • 离散伪码(事件驱动)

    # 每时间步 t:
    for each synapse ij:
        e[ij] = gamma_e * e[ij] + local_term( pre_j[t], post_i[t] )  # e.g. pre_j[t]*post_i_trace
    
    # 当 modulatory signal M[t] 到达时:
    for each synapse ij:
        w[ij] += eta * M[t] * e[ij]
    
  • 参数/时间尺度建议

    • γe\gamma_eγe 取决于奖励延迟:若 reward 延迟较长,τe\tau_eτe 需更大(例如数百 ms 到 秒 级)。
    • local_term 选取需与 spike 形式对应(例如对于 LIF,可用预迹 xjx_jxj 和后膜触发函数 ϕ(Vi)\phi(V_i)ϕ(Vi))。
    • baseline b:可用滑动平均奖励 Rˉ\bar RRˉ
Homeostatic / 稳态可塑性(Synaptic scaling 等)
  • 概念与目的

    Hebbian 增强会使某些神经元兴奋度持续提高,为防止网络崩溃或沉默,神经元/网络有慢尺度机制维持平均放电率在目标范围,这称为 homeostatic plasticity。常见生物机制包括突触尺度调节(synaptic scaling)和调节 excitability(膜通道表达)。

  • 突触尺度调节(multiplicative scaling)

    理想目标:保持神经元平均输出 ⟨yi⟩\langle y_i \rangleyi 接近目标 ytargety_{target}ytarget,同时保留输入权重的相对比例(即 normalization but multiplicative)。

    常见离散更新:
    wij←wij⋅(1+ηh (ytarget⟨yi⟩−1)) w_{ij} \leftarrow w_{ij} \cdot \Big( 1 + \eta_h \, \big( \frac{y_{\text{target}}}{\langle y_i \rangle} - 1 \big) \Big) wijwij(1+ηh(yiytarget1))
    或写为平滑泄减形式(连续):
    dwijdt=κ (Ytarget−⟨yi⟩) wij. \frac{dw_{ij}}{dt} = \kappa \, \big(Y_{\text{target}} - \langle y_i \rangle\big)\, w_{ij}. dtdwij=κ(Ytargetyi)wij.
    推导/说明

    • 乘性项 ×wij\times w_{ij}×wij 保持不同突触间比值不变(如果所有权重同乘以同一因子),因此保留“学习到的相对结构”但调整体增益;
    • 时间尺度通常慢(小时到天),用于长期稳态。
  • 归一化(additive 或 multiplicative)

    另一种常见实现是按 postsynaptic 对所有输入权重做归一或投影:

    • L1 归一化: ∑jwij=C\sum_j w_{ij} = Cjwij=C
    • L2 归一化或投影至单位范数

    这些约束在实践中常与 Hebb 或 STDP 联合使用,防止 runaway。

  • 伪码(周期性更新)

    # 每 T_homeo 秒:
    for each post neuron i:
        r_i = estimate_mean_firing_rate(i)
        factor = y_target / (r_i + eps)
        for each presyn j:
            w[i,j] *= factor**alpha  # alpha \in (0,1) 学习率
    
    
Heterosynaptic plasticity(异突触可塑性)
  • 概念

    当一个突触发生 LTP/LTD 时,其他(可能未活跃的)突触也出现补偿性改变;这是“非局部”的可塑性,常被视为一种局部 homeostasis 或竞争机制。

  • 简单数学模型

    一种简化形式:

    Δwik=Hebbian_termik−β∑j≠kHebbian_termij \Delta w_{ik} = \text{Hebbian\_term}_{ik} - \beta \sum_{j\ne k} \text{Hebbian\_term}_{ij} Δwik=Hebbian_termikβj=kHebbian_termij

    Δwik∝Hebbik−β Hebb‾i \Delta w_{ik} \propto \text{Hebb}_{ik} - \beta \, \overline{\text{Hebb}}_i ΔwikHebbikβHebbi

    其中 Hebb‾_i\overline{\text{Hebb}}\_iHebb_i 是 postsynaptic i 对所有输入的平均 Hebbian 驱动,β\betaβ 控制补偿强度。

    这样做能在局部保持总输入大小相对稳定,并引入竞争(强的突触加强会导致其他突触减弱)。

  • 作用

    • 防止少数突触无限制增强
    • 引入稀疏性和竞争性表示
短时可塑性(STP,Tsodyks–Markram 模型)
  • 概念

    STP 发生在 ms–s 时间尺度:突触响应对短期历史敏感,表现为 短暂增益(facilitation)突触疲劳/抑制(depression)。它不是长期权重改变,而是瞬时的可用资源或利用率变化,影响瞬时突触传递。

  • 常用模型(Tsodyks–Markram)

    变量:

    • R(t)R(t)R(t):可用资源比例(0…1)
    • u(t)u(t)u(t):每次 spike 时利用率(release probability 的动态量)

    参数:

    • UUU:基线利用率增量参数
    • τ_D\tau\_{D}τ_D:恢复(depression)时间常数
    • τ_F\tau\_{F}τ_F:促进恢复时间常数

    离散事件驱动更新(在 presynaptic spike 时刻):

    u←u+U(1−u)x←x(1−u)(这里 x 等同于 R)PSC (amplitude)∝A u x \begin{aligned} u &\leftarrow u + U(1-u) \\ x &\leftarrow x (1 - u) \quad\text{(这里 x 等同于 R)}\\ \text{PSC (amplitude)} &\propto A\, u\, x \end{aligned} uxPSC (amplitude)u+U(1u)x(1u)(这里 x 等同于 R)Aux

    连续衰减(未发 spike 时):

    dudt=−uτF,dxdt=1−xτD. \frac{du}{dt} = -\frac{u}{\tau_F},\qquad \frac{dx}{dt} = \frac{1-x}{\tau_D}. dtdu=τFu,dtdx=τD1x.

    (记法上有多种变体,x 或 R 表示可用量。)

  • 稳态对 Poisson 输入的解析—简要

    对于恒定 Poisson 率 rrr,稳态值可求解(略去推导细节):有效突触平均传递率约为

    efficacy∝U1+r τD U(若以 depression 主导) \text{efficacy} \propto \frac{U}{1 + r \, \tau_D \, U} \quad\text{(若以 depression 主导)} efficacy1+rτDUU(若以 depression 主导)

    意义:高频输入会使突触抑制(降低响应),低频输入维持高应答(或相反对 facilitation)。这给突触带来频率选择性。

  • 伪码(事件驱动)

    # on presyn spike at time t:
    u = u + U * (1 - u)
    x = x * (1 - u)
    psc = A * u * x
    # between spikes: u *= exp(-dt/tau_F); x += (1-x)*(1-exp(-dt/tau_D))
    
结构可塑性(Synaptogenesis / Pruning)
  • 概念

    长期尺度(天–周):神经元可以新建/修剪树突或轴突上的突触。模型通常是随机的 birth-death 过程但受活动驱动调节。

  • 简单模型

    • 每一对 neuron (i,j) 有存在概率 p_ij(t)p\_{ij}(t)p_ij(t);更新规则可能是:

      dpijdt=α⋅F(activityi,j)−β⋅pij \frac{dp_{ij}}{dt} = \alpha \cdot F(\text{activity}_{i,j}) - \beta \cdot p_{ij} dtdpij=αF(activityi,j)βpij

    • p_ijp\_{ij}p_ij 越过阈值时形成突触;低于阈值则修剪。

    用途:网络可以重构连通性以适应长期统计、节省代价、维持效率。

元可塑性(Metaplasticity)与 BCM 规则
  • 概念

    元可塑性指可塑性机制本身可以随历史被调节(例如阈值滑动)。
    BCM(Bienenstock-Cooper-Munro)是一个经典模型:权重更新与输出 yyy 的差于滑动阈值 θ\thetaθ 有关:
    Δw∝xy(y−θ), \Delta w \propto x y (y - \theta), Δwxy(yθ),

    并且阈值滑动为(平均平方活动):

    τθdθdt=y2−θ. \tau_\theta \frac{d\theta}{dt} = y^2 - \theta. τθdtdθ=y2θ.

    含义:当输出小于阈值 (y<θy < \thetay<θ) 时 LTD(削弱),当 y>θy>\thetay>θ 时 LTP(加强);阈值随历史活动上升,提供 homeostasis。

  • 数学效果

    • 在稳态下 θ≈E[y2]\theta \approx \mathbb{E}[y^2]θE[y2],从而规则会稳定网络整体活性并对频率敏感。
Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐