我搜索了两万个YouTube评论 视频和评论有两种不同的对话.

2026年8月25日2 次浏览来源:Dev.to阅读原文

我曾经从大约140个韩国YouTube视频中收集了大约22 000个评论, (下文引自韩文).

我想看看人们问的是什么 出来的东西是别的东西。

这些视频教给人们的是什么 把这些140个视频的标题和标签放入一个堆里,他们说: 如何安装。

如何从起.

如何构建应用.

哪个工具最好 这一切都是"开始"。

随即,结果出现在屏幕上,视频结束.

评论说,这些评论 扫荡了类似 讲述了一个不同的故事。 "验证AI错误需要太多时间.

查查每个无稽之谈的答案让我很累, 如果一只虫船,我负责。

逐个检查和调试每件事,结果都成了更多的活" (QQ265)"我每个月都付钱,而且它谎称工作如一无是处" (QQ72)"托肯斯烧得太快了...加了50美元,半天就不见了" (QQ30)".

它压缩为三个抱怨:昂贵,无法相信,无法修复.

视频教开始。

众生起后即生.

最可怕的评论是"为了洗发水建议而把它卖掉,它推荐了一个不存在的.

在真正的产品之间滑入,有重量,好处,甚至价格。” (QQ49)这一评论是问题的实质。

当AI错了,它看起来并不错了.

假的坐在真实的中间, 带着可信的数字。

这就是为什么"只要写出更好的提示"是半个答案.

最好能降低出错的几率 他们不会创造出一种方法来知道什么时候是错的.

错误率从10%降低到3%,你仍然不知道3%藏在哪里.

如果3%的电源在支付逻辑中引爆 钱就会离开大楼 还有一个发现——在收集真正问题的同时,我注意到评论的性质随着频道大小的变化而变化。

是旁观者与实际做这件事的人的区别.

在大视频下的评论会问"AI时代我们发生了什么".

中大小频道下的评论会问"我如何纠正这个错误".

真正的问题是在中等规模的渠道。

而收集回音线程,不只是顶级评论,还浮出470个顶级从未显示的需求.

所以我选择了一个方向 内容 教开始已经无所不在。

我决定在开始后立即进行拉伸工作——不能信任它,不能固定它拉伸.

这个系列中较早的帖子是这一决定的第一个结果:给我的LLM考试,在考试中设置陷阱,按严重程度分级而不是通过/失败,为什么通过仍然不足以运送.

每一个都是为了把"我无法相信"变成"我验证了".

众生起起起不生.

他们死后就死了 但几乎所有人都在卖起步器 P.S.

产生上述百分比的分类员后来参加了自己的考试——我给我的LLMs的同类考试——并失败了三个致命等级的问题。

公开的校正是它自己的故事,在本系列的后期出现.

接下来:如何偷这个考试 并把它移植到你自己的管道,一步一步.

分享