本地口述模式 — 免费、私人化的 OpenAI 实时语音替代方案
作者: radicax创建于 2026年9月6日更新于 2026年9月14日
** 定期请求:** 添加本地,离线的拼写模式,作为内置语音模式(需要OpenAI Realtime + API密钥)的替代.
**为什么:**语音模式被硬码为OpenAI Realtime——它需要API密钥,每分成本,并发送音频给OpenAI. 许多用户(尤其是美国境外或有隐私顾虑的用户)都想要百分之百本地运行的语音对文字,
我所创造的作为概念的证明:** 一个在 Linux 上这样做的小脚本 :
- 通过奥迪奥港捕获米克(16克赫兹)
- Silero VAD(神经语音活性检测,~1ms/block CPU)——在吵闹的房间里坚固,与能动VAD不同.
- ** faster-whiper**(Ctranslate2) 完全本地化的缓存模型
- 通过本地桥(`composer.set text')将文本推入OpenWork作曲家
它今天的工作: 说话 暂停 文字出现于作曲家. 没有 API 键,没有云,~1GB RAM,运行于CPU上.
** 建议执行:**语音模式设置中的"本地口音"选项,将OpenAI实时后端交换给本地的微声管(或曝光可插接的STT后端). 乐于与我分享完整脚本和我击出的照片(Silero块大小512@16kHz,PortAudio缓冲再用,ctranslate2/OpenMPI segfault work around),
** 福利:** 免费、私人、离线,与任何模型/提供者一起工作,不支付每分钟费用.
内容来源: different-ai/openwork