深度神经网络的泛化能力与结构有效性,长期以来被隐含归因于连续权重数值的优化结果,而忽略了权重符号所承载的结构性先验。近年来基于彩票假设与符号显著性的研究表明,在过参数化模型中,权重符号对网络功能、连接逻辑与泛化上限的决定性作用显著高于权重幅值,数值仅承担信号强度缩放的次要角色,网络的核心能力本质上由内部稀疏且高效的子网络结构决定。由于现实任务具有高度多样性与领域差异性,不同任务往往对应结构与符号分布存在显著差异的最优稀疏子网络,现有Xavier、He等经典初始化方法仅关注数值分布稳定性,无法引入与任务结构适配的符号先验,难以支撑面向多领域、多模态场景的高效建模。

 

基于上述认知,本文提出一套以符号结构为核心的神经网络初始化与多模态融合框架:从预训练大模型中提取面向单领域任务的最优稀疏子网络,保留其具有结构有效性的符号模式,对幅值部分采用Xavier分布重初始化以保证训练稳定性;在训练过程中,先通过符号约束稳定核心结构,再解除限制实现全参数自由优化,在继承高质量结构先验的同时保持对新任务的适配能力。进一步地,本文将该思想拓展至多模态建模场景,提出跨领域稀疏子网络兼容与融合范式:对视觉、语言、音频、生成建模等各领域专用大模型的稀疏子网络进行符号空间统一与结构对齐,构建包含领域专属最优子网络的超级网络,并通过动态路由机制实现面向不同任务的子网络按需激活。

 

该架构突破了传统稠密多模态模型中任务干扰、能力均衡性不足的瓶颈,使得模型在覆盖全模态能力的同时,在各单一领域性能上均可匹配甚至超越对应领域专用模型。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐