建议:共享Sparse Latent Neural Bus 用于本地的 QQ 云型号
提议:共享Sparse Latent Neural Bus 用于本地的 QQ Cloud 模型
□ 思想
目前本地到云的AI系统主要通过自然语言符号来进行交流.
我提议用不同的抽象来试验:
** 本地小模型和大云模型之间的机器内生神经交流层。 **
代替:
" 当地模式-文本/托盘-API-云模式 "
使用:
`本地隐藏状态-适配器-共享稀有潜在总线-适配器-云隐状态'
同一界面在相反的方向工作.
□ 共享神经界面
让通信空间成为一个大的矢量:
" Z. ^ R.N. "
例如:
`N = 65 536 - 1 048 576'
但每个消息只有少量潜在通道活动:
`Top-K(Z)<<-N'
例如:
`1 048 576个现有渠道 ' " 2,048个活动频道 "
因此,传送的神经包只能包含:
`(地貌-d,活化)'
而不是密集的收音机或符号序列。
这创造了大量的平行神经通信渠道.
□ 不同的模型,相同的语言
本地和云模型不需要相同的架构.
每个模型都有自己的适配器:
`H 地方-编码器-地方-Z'
`Z'- 解码器- 云 - 高云'
而反之亦然。
潜在的空间`Z'是共享的。
适配器在每一个模型的本土隐藏代表与常见神经语言之间翻译.
□ 自学协议
不应手工界定潜在渠道的含义。
协议应通过端到端培训产生:
" 当地模式 " 页:1
- 云型号
任务成果
损失额
渐变器训练通信界面,使其内部语言向改善实际任务性能的表达方式发展.
其他目标可以鼓励:
- 痉挛;
- 独立的潜在特征;
- 低带宽; 周期一致性;
- 缺少渠道;
- 模型版本之间的兼容性。
一个可能的目标:
L = L 任务 + + + + 1 L sparse + + + → 2 L 循环 + + → 3 L 独立 + + + + 4 L 带宽'
□ 镜像/共享接口
共享协议层可以在两个端点上使用同步权重.
建筑专用适配器仍为私有:
" 当地模式 " 本地适配器 ' 共享协议层 ' 页:1
和:
`Z ' 号 共享协议层 ' 适应云器
- 云型号
在适当情况下,编码器/解码器的转换可以使用捆接或转接重量.
∮为什么这很重要∮
自然语言是一种相继的人类交流协议.
一个神经模型同时代表许多事物:
- 意图;
- 不确定性;
- 其他假设;
- 关系;
- 记忆状态;
- 规划状态;
- 候选人行动。
将所有这些内容按顺序排列为文本,可能是模式间通信的一个不必要的瓶颈.
少量的潜在总线可以平行地传送这种信息。
□与当前研究的关系
这一想法与以下方面的积极工作有关:
- 潜在的交流;
- 持续推理;
- KV-缓存转移; . . . . . . .
内容来源: openai/evals