[功能] 为聊天/客服提供统一的音频输入和转录工作流程
作者: DracieVajko创建于 2026年9月16日更新于 2026年9月16日
标签enhancementready for review
预备知识
地区
聊天 / 代理
问题或动机
Odysseus 已经包含了多个语音转文字和音频功能,包括本地的 faster-whisper 支持、麦克风录音、STT API 端点和音频文件上传。
然而,这些功能目前是断开的。
现有的麦克风路径可以录制音频并将转录插入聊天编辑器中,但麦克风控制与现有的“发送”按钮行为绑定,并不是一个明确可发现的独立音频工作流程。
音频文件已经可以作为聊天附件上传,但上传的音频目前通过多模态附件路径传输,而不是通过现有的 STT 服务。这意味着来自电话的录音(例如会议、讲座、采访或个人笔记)没有一个统一的“转录并继续与之工作”的工作流程,适用于以文本为主的聊天 / 代理模型。
还没有显示的 STT 设置工作流程来选择本地 Whisper 模型或配置转录语言,尽管后端已经具有 stt_model 和 stt_language 设置。
一个实际的自主托管用例是:
电话录音
-> 上传录音到 Odysseus
-> 本地 Whisper 翻译
-> 保留原始转录
-> 可选将其发送给当前的聊天 / 代理模型
-> 可选生成经过清理的转录、摘要或结构化笔记
这将使现有的 STT 和附件基础设施变得更加有用,而无需用户在 Odysseus 外部手动将录音转换为文本。
建议的解决方案
在现有的 STT 和附件基础设施上添加一个统一的音频输入和转录工作流程。
1. 聊天编辑器中的麦克风输入
在聊天编辑器中添加一个专用的麦克风 / 语音转文字按钮,而不是重用或改造“发送”按钮。 编辑器应保留现有的“发送”操作作为一个单独的控件。 概念上:
+----------------------------------------------------------------------------+
| [展开] [搜索] [终端] [附件] [麦克风] [代理 / 聊天] [↑] |
+----------------------------------------------------------------------------+
现有的麦克风录音实现应被重用,而不是创建第二个录音系统。
预期流程:
麦克风
|
v
录制音频
|
v
本地 / 配置的 STT 提供商
|
v
转录
|
+--> 插入到编辑器中
|
+--> 发送到当前的代理 / 聊天模型
用户应该能够在发送之前查看转录,同时还可以
…
内容来源: odysseus-dev/odysseus