YouTube 视觉 OCR 输出使用基于索引的时间戳,而不是真实的帧时间
作者: shaun0927创建于 2026年4月17日更新于 2026年4月17日
□ 说明 YouTube视觉取出功能目前根据OCR结果指数而不是实际帧时间来释放出类似字幕的时间戳.
这意味着输出可以看起来时间精确,同时实际上指向源视频中的错误时间.
□ 受影响地区
- “内部/工具/Youtube/Youtube.go”
- 目前上游I经当地验证:
9743e10273c45e1c377c10ec0ffaf0de8fefb3c8'(v1.4448')
∮为什么这样∮ `Grab Visual ()' 选择使用下列两种方法之一的框架:
- `fps-d',或
- `select='gt(场景,%f)''
但后来使用:
开始 秒数:=i
因此,Nth OCR结果被标记为"第二"n",无论这个框架是何时实际发生的.
∮为什么这很重要∮
这个功能是为了从视频中取出有意义的视觉文本. 错误的时间戳会降低对输出的信任并会误导下游的提示或用户将OCR文本归咎于源视频中的错误时刻.
□ 本地验证证据
我在当地用一个有重点的试验来复制,它嘲弄`yt-dlp'、`ffmpeg'和`sectract':
{\fn黑体\fs22\bord1\shad0\3aHBE\4aH00\fscx67\fscy66\2cHFFFFFF\3cH808080}你觉得呢?
进行测试 ./ 内部/ 工具/ youtube - 运行“ Test Grab Visual usesFrameTimes FromFFmpeg” - v在repro中,"Grab Visual (., fps=2)"生成了两个OCR帧,当前上游行为按照指数而不是实际帧时间标出第二个帧.
我准备了一个小的固定装置 保留了ffmpeg衍生的帧时间 包括回归覆盖.
内容来源: danielmiessler/Fabric