我曾经从大约140个韩国YouTube视频中收集了大约22 000个评论, (下文引自韩文).
我想看看人们问的是什么 出来的东西是别的东西。
这些视频教给人们的是什么 把这些140个视频的标题和标签放入一个堆里,他们说: 如何安装。
如何从起.
如何构建应用.
哪个工具最好 这一切都是"开始"。
随即,结果出现在屏幕上,视频结束.
评论说,这些评论 扫荡了类似 讲述了一个不同的故事。 "验证AI错误需要太多时间.
查查每个无稽之谈的答案让我很累, 如果一只虫船,我负责。
逐个检查和调试每件事,结果都成了更多的活" (QQ265)"我每个月都付钱,而且它谎称工作如一无是处" (QQ72)"托肯斯烧得太快了...加了50美元,半天就不见了" (QQ30)".
它压缩为三个抱怨:昂贵,无法相信,无法修复.
视频教开始。
众生起后即生.
最可怕的评论是"为了洗发水建议而把它卖掉,它推荐了一个不存在的.
在真正的产品之间滑入,有重量,好处,甚至价格。” (QQ49)这一评论是问题的实质。
当AI错了,它看起来并不错了.
假的坐在真实的中间, 带着可信的数字。
这就是为什么"只要写出更好的提示"是半个答案.
最好能降低出错的几率 他们不会创造出一种方法来知道什么时候是错的.
错误率从10%降低到3%,你仍然不知道3%藏在哪里.
如果3%的电源在支付逻辑中引爆 钱就会离开大楼 还有一个发现——在收集真正问题的同时,我注意到评论的性质随着频道大小的变化而变化。
是旁观者与实际做这件事的人的区别.
在大视频下的评论会问"AI时代我们发生了什么".
中大小频道下的评论会问"我如何纠正这个错误".
真正的问题是在中等规模的渠道。
而收集回音线程,不只是顶级评论,还浮出470个顶级从未显示的需求.
所以我选择了一个方向 内容 教开始已经无所不在。
我决定在开始后立即进行拉伸工作——不能信任它,不能固定它拉伸.
这个系列中较早的帖子是这一决定的第一个结果:给我的LLM考试,在考试中设置陷阱,按严重程度分级而不是通过/失败,为什么通过仍然不足以运送.
每一个都是为了把"我无法相信"变成"我验证了".
众生起起起不生.
他们死后就死了 但几乎所有人都在卖起步器 P.S.
产生上述百分比的分类员后来参加了自己的考试——我给我的LLMs的同类考试——并失败了三个致命等级的问题。
公开的校正是它自己的故事,在本系列的后期出现.
接下来:如何偷这个考试 并把它移植到你自己的管道,一步一步.