教授更多关于巴巴多斯的音频模型

2026年8月7日1 次浏览来源:Dev.to阅读原文

在有人提到当地学校、村庄、政治家、节日或板球场的名字之前,自动语音识别是非常好的。

然后事情变得奇怪。

在较早的一次使用巴巴多斯音频的测试中,GPT Translatis和GPT Audio 1.5听到事件名称"Rise together"为"Rice together",而Quen3.5-Omni Plus和Flash则得到正确.

这些模型不同于这里使用的Quen3-Omni检查站,但结果促使了这一实验.

从理论上讲,这个错误是可以理解的。

在文化上,这是错误的。

一个了解本地背景的人还有另一个信号:他们知道共同崛起是可信的名字.

这让我提出一个问题:我们能否给巴巴多斯一个更强大的音效模型,使用已经包含它可能听到的名称、机构、地点、事件和关系的文本?

于是我把巴巴多斯报纸的存档, 变成5160万个代币, 并用它来对Qune3-Omni内部的思考者进行域-适应性预训。

结果是有希望的,但不是结论性的。

调整后的模型在巴巴多斯初步知识调查中取得了更高的分数,特别是在人员和机构方面。

在一套小的通用知识控制上也略有恶化.

最重要的是,我们还没有证明它能更准确地记录音频。

这是一个非常初步的结果。

它来自我们的第一次训练, 我们停止了500步 计划801步。

我们还在提取报纸档案,因此,5 160万个培训信使代表了可供运行的材料,而不是我们最终打算使用的全部档案。

这篇文章是关于我们实际展示的, 沿途突破的, 以及为什么我认为实验仍然值得追求。

问题不光是音响 A的转录模型 不只是把声音转换成字母 当音频干净而一字通俗时,声学证据就足够了.

但真正的收音机是压缩的.

音乐漏入演说.

演讲者说话快点 电话来宾有不同的麦克风和口音.

适当的名词可能很少见,或者从模型的原始训练数据中缺失.

这时,抄录成为了假象序列之间的竞争: 对巴巴多斯来说,有用的背景包括: Kensington Oval Cave Hill Samuel Jackman Prescod Polytechnic Crop Over 选区和教区命名当地政治家、运动员、表演者和组织,所有这些事物之间的普通关系 这与自动语音识别的背景偏向有关。

在 " 深度背景 " 中,庞达克和同事表明,端到端识别器可以使用所提供的上下文短语,包括省外术语,并报告说,相对的字率比其任务提高了68%。

后来关于以三相为基础的深度偏差和浅聚变的研究表明,相对于现有的上下文偏差方法而言,相对改进了19.5%,尤其要注意罕见的长尾词.

这些系统在推断时明确提供了一份偏向性清单。

我们的方法不同:我们试图使当地背景成为模型所学语言的一部分。

这些文件没有直接证实我们的方法,但它们确实支持一种基本的想法,即上下文有助于认识者解决稀有和模棱两可的语言。

为什么是Qune3 -Omni?

我选择了Qune3-Omni-30B-A3B-指令,因为它是本土多模式的.

它接受文本,音频,图像和视频,可以产生文本或语音.

更重要的是,对于这个实验,它的音频理解和文本生成是一端到一端架构的一部分.

根据"Qune3-Omni"技术报告,该模型使用"Mixture-of-Experts Thinker-Talker"设计:"思想家"消费多式代表并生成文本.

说客负责生成流传的语音符号.

一个音频变形器(Audio Transformer),即AuT,将音频变成由思考器所消耗的表示.

分享