
深度学习是基于多层神经网络的复杂数据处理技术,突破传统机器学习的局限性。包括:
Transformer:基于自注意力机制驱动的长文本处理通用架构(如GPT系列、BERT)。
扩散模型(Diffusion Model):通过逐步去噪生成高质量数据(如Stable Diffusion)。
MoE(Mixture of Experts):组合多个子模型提升性能(如Switch Transformer)。
SNN(脉冲神经网络):模拟生物神经脉冲时序的模型。
胶囊网络(Capsule Network):通过胶囊单元编码空间层次关系。