我经营一个小型的本地模型——通过Ollama的Quen3.5 4B——作为某种工具内部的决定性检查步骤。
这是今天仍在复制的, 在命名的版本上, 用脚本亲自检查。
如果结果无法幸存下来,那也在这里,因为事实证明这是最有用的部分。
版本,可以指: Ollama 0.32.6,型号,文摘,Q4 K M.
这些都不是新技术。
其基本模式是具有验证器的 " 最佳N " ,这是公认的。
这些是已知模式内的测量结果。
如果思维允许,思维链和最终答案共享一个象征性的预算。
当思维消耗它时,在持有内容的同时会空出.
仅读取的代码只看到并结束呼叫失败 。
它没有。
测量今天,一行问题,: 固定:用于取出和结构化的任务,读出两个字段,或者关闭思维.
它是否触发取决于你的预算——收紧使之有可能。 (分出:有证据表明将长时间的思维链推入小模型会损害精度——罗等,"穿透谷道:为小语言模型进行有效的长相CoT训练的途径",EMNLP
2025.
这是一个训练时间效应,而不是这个API 外地路线的怪异。
不同的问题;注意它,以免两人被混淆. ) 我要求它批评它自己的答案, 它口头地收回了错误的修补——"收回上面提出的支票",然后在代码中重新发回同样的错误修补,在同一回执中.
在"Large Language Models Concept Self-Correct Reasoning Yet"(arXiv:2310.01798,ICLR 2024)中,黄克华等人在GSM8K上衡量尺度的一例传闻:GPT-4自身精度下降95.5%~91.5%~89.0%在固有自律下.
自律不是自由可靠性层.
你需要一个外部法官,而不是模型本身的评级。
请求精密节拍模型深度 相同的输入,两个提示。
询问匹配源名的输出密钥字面上移动了精度 7/10
10.
一个数字谱——"每行有正3个格和正4个破折"——固定了一张表,一个描述性谱——"一个造型良好的分隔行"——继续产生断裂.
成熟的即时工程建议。
仅仅因为我有相同的输入的前/后。
外部法官需要它自己的负面控制 这里有段时间我搞错了,这是昂贵的。 "对产出进行定型外出检查"是半个指令.
我有那张支票。
它传递了一个捏造。
合并任务 二列为一行,八十一行.
模型发明了5个从未输入的值.
检查还原, 和退出代码0。
它没有绕行,也没有坠毁。
每个被发明的值都取自一个封闭的词汇——每一个可以出现的值确实出现在输入的某个地方——因此,检查所运行的每一个符号级的断言都满足了.
法官被问到一个无法将这两个案件分开的问题。
因此,我要给一个开始这一点的人:一个从未失败过的法官并没有被证明是失败的。
建立支票,然后输入它必须拒绝的材料。
如果它保持绿色,你就没有法官——你有第二件事同意模型.
而当输出是输入的纯函数时,在接受输入之前,先与输入进行机械比较.
退出代码不是证据 一个没有活下来的结果 我之前的一篇笔记报告说,这个模型将空间缩小到拉丁语的"阿拉伯"边界上——要求返回。
我在两跑中的两跑中得到了它 并把它当作一个真正的缺陷。
今重行:53代.
零再现.
被钉模型上有7个即时形状,其中6个是重复在另外两个本地4B变体上,加上原来的回声即时.
我不能告诉你这是固定的,我也不会假装别的东西——磁盘上的模型文件就是我第一次测量时在场的.
快速形状也不能解释,我试过