我将要描述的每一次失败 都产生了干净的跑道 没有例外,没有堆放痕迹,没有红色建筑。
每一个都产生了一个可信的数字 我认为比我应该有的时间更长。
这是我最害怕的虫类 坠毁告诉你它坠毁。
一个静静地破碎的数据集完全没有告诉你,你的衡量标准会礼貌地同意.
这是去年的3个 都是我个人的作品 都发现很晚
- 92%的I类数据集为多类视觉语言工作培训了688个记录。
十三类.
合理大小的微调, 已经用于完成的训练 运行,我写了结果。
在准备分级时,我将记录与源代码对照,并实际计算类别。 688中的630个是单一类别:场景字幕.
交通信号零例.
规划零.
起无常相.
明确衡量的评价的几个类别在培训方面根本没有代表性。
先前的微调表明,其中一些类别有所改进。
我把它解释为学习任务的模式。
真正的解释更乏味更有用:模型从字幕监督中学习了答案格式,单格式校正就足以移动多选择分数.
没有具体类别,因为没有具体类别。
其根源是上游和无聊的。
转换脚本我只继承了重写文件路径并丢弃了缺少帧的记录.
它忠实地保留了在链条上更上一层的只标注一个选择。
它对平衡没有意见,因为没有人要求它拥有平衡。
我所改变的:一个训练场的构成 现在是一个我创造和检查的文物 在任何运行之前, 而不是我想象的财产。
分类直方图需要几秒钟。
我几个月没看了 - 18小时的运行,完美地与一无所有的大型模型,QLORA,多GPU,每个样本8个相机取景.
大约一天的计算。
损失曲线很美。
它在前26个步骤上从19.4跌到15.7,再由51步跌到0.078,再在0.02附近平地并停留在那里.
托肯精度达到0.99.
渐变规范平稳地衰变.
训练中的遥测仪看起来没有问题 任务衡量标准为0.10。
原因:我在监督自由文本的答案, 中值11个字, 短语像“一个人应该保持 右侧的道路并慢地开车。” 评价是四可选的多种选择,在所选选择的指数上得分。
模型迅速而正确地学习了再现了训练答案的风格.
这才是损失的真正要求,它最多用了大约50个步骤。
它从未被要求选择一个选项,所以它从未学会.
培训和评价正在衡量不同的任务。
两者在内部都是一致的。
也无法察觉对方的分歧.
我所改变的:在长期开始之前, 我现在写下什么是 eval 度量,什么是损失的优化, 每行一行, 检查一下它们描述的是同样的事情。
当损失在十几步内下降到接近零时,我认为这是个警报而不是一个成功。
真正的学习 一个艰巨的任务看起来不是这样。
3.
与档案规模相去40%的数据集声称,评估大型公共机器人程序书以供采用。
头条:3.91 TB被压缩,4.65 TB被提取出,有上百个沙地,数十个建筑,数千小时的远程操作操纵.
重要的号码被埋入了论文的方法部分.
只有约60%的原始数据被转换成可靠的3D流注.
其余的都失败了深度估计,相机摆出优化,或者点跟踪.
然后,进一步的滤波器只保留有实际机器人-物体接触和真实物体运动的轨迹.
名义尺寸:上千小时.
两个过滤器之后的训练准备大小:大约500小时。
每个计划