我双重特斯拉P40的旗子是...
它将每层的收发量分成了两个GPU,它的价值几乎是替代物的吞吐量的两倍:12-14个令牌/秒,对分层约7个.
我建造的每一堆都围绕着它 2026年7月,上游ella.cpp将其删除.
不堕地.
删除。
这是一次两次死亡的表演规则的故事, 以及用它取代了吞吐量。
这是我笔记中最长的弧线,它以5个动作运行.
第1幕:排胜出2026年2月出道.
我的第一个严肃的模型,一个72B, 开始在2.7到3.6个符号/秒在我的笔记中礼貌地称为"差的配置".
将卸载阶梯提升到完整的GPU居住状态并切换到排分,产生了第一个真正的日常驱动程序:大约10.3个令牌/秒生成,60个令牌/秒快速处理.
站立规则结晶:行分出,12-14个符/秒.
分层,大约7个 一个卖家博客的传言说,一个更新的"图"分拆模式又值30-40%.
第2幕:2026年3月回归事件.
我在"现代"分叉上重建了同一种模型,并一次修改了四个变量:分块模式,SIMD编译旗帜,内核选择方法和压缩设置.
快速处理从153个令牌/秒倒闭到29个.
速度慢了5倍,同时有4个变化,没有任何可归咎的. 3月4日的清理A/B隔离了一切.
相同的模型,相同的快取,一次一个变量: 原二进制,行分出:60个符/秒快取,10.3个生成. - 工作上的工作。 - 对。
新的分叉,分层:速度的一半.
新的分叉,图解: CUDA崩溃. "快40%"的图表模式完全不运行在帕斯卡上.
这就是社区主张与自己硬件上的测量的区别:其中之一可能会崩溃.
当日写下的判决: 原二进制是本硬件的最佳,不要切换.
一个规则诞生了,我现在把它当作是不可谈判的:每个变化一个变量。
这条规则是按损失的吞吐量和浪费的一周来支付的。
第3幕:快取模式成为错误模式 2026年5月.
Gemma 4已到来,其架构使用共享的 KV 层作为 lamor 视图执行.
这些崩溃行在多GPU上分裂出,这是CUDA后端的一个硬性断言,已知的上游问题.
我运行的每个Gemma堆栈都是按需要分层的,故意支付吞吐量成本.
Quen建筑没有这样的bug并保持行.
因此分拆模式不是一个性能拨号.
也作正取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取 "鲁迅更快"是真实的,没有附加条件的无用.
第4幕:上游删除了2026年7月6日行. lama.cpp完全被删除.
由更新型的克隆人所建的任何堆栈都有分层作为其唯一的多GPU选项.
我组织我的舰队的旗帜 不再存在于我建造的二进制中 Row死了两次,分出两行:首先叉子取而代之的是撞倒了Pascal的模式,再从上游直接取出.
第5幕:胜利从别的地方回来 这是证明整个磨难合理的一部分 在新堆上,地层单独分解测量出8.46个令牌/秒单流,正好是旧"层约7"规则所预想的地方.
但2月的二进制中并不存在的两个特征改变了数学: (四个并发的插槽):8.46/12.8/15.0个符号/秒在1,2和4个插槽.
在每片纬度下降之前,总吞吐量几乎翻了一番。
MTP投机解码:8.46至约13.3个令牌/秒单流,升降57%,接受率0.38至0.63,产出正确性得到核实.
净结果:舰队最终比分行时代快而无分行.
恢复不是因为找到一面替代旗帜.
它从正交特征到失去的特征 这教会了我 日期印 每一份业绩申报 并命名二进制 调制规则是指特定时刻的特定文物的事实,而不是硬件定律.
当你转动的旗子消失, 重新测量之前假设Reg