#6319·odysseus

[功能] 为聊天/客服提供统一的音频输入和转录工作流程

作者: DracieVajko创建于 2026年9月16日更新于 2026年9月16日
标签enhancementready for review

预备知识

  • 我搜索了 开放问题 并发现此问题尚未被提议过。
  • 我搜索了 讨论 并发现此问题尚未在其中进行讨论。
  • 这是一项具体的、可执行的提案 - 而不是一个模糊的"如果这样做会很好的话"的请求。

地区

聊天 / 代理

问题或动机

Odysseus 已经包含了多个语音转文字和音频功能,包括本地的 faster-whisper 支持、麦克风录音、STT API 端点和音频文件上传。 然而,这些功能目前是断开的。 现有的麦克风路径可以录制音频并将转录插入聊天编辑器中,但麦克风控制与现有的“发送”按钮行为绑定,并不是一个明确可发现的独立音频工作流程。 音频文件已经可以作为聊天附件上传,但上传的音频目前通过多模态附件路径传输,而不是通过现有的 STT 服务。这意味着来自电话的录音(例如会议、讲座、采访或个人笔记)没有一个统一的“转录并继续与之工作”的工作流程,适用于以文本为主的聊天 / 代理模型。 还没有显示的 STT 设置工作流程来选择本地 Whisper 模型或配置转录语言,尽管后端已经具有 stt_modelstt_language 设置。 一个实际的自主托管用例是: 电话录音 -> 上传录音到 Odysseus -> 本地 Whisper 翻译 -> 保留原始转录 -> 可选将其发送给当前的聊天 / 代理模型 -> 可选生成经过清理的转录、摘要或结构化笔记 这将使现有的 STT 和附件基础设施变得更加有用,而无需用户在 Odysseus 外部手动将录音转换为文本。

建议的解决方案

在现有的 STT 和附件基础设施上添加一个统一的音频输入和转录工作流程。

1. 聊天编辑器中的麦克风输入

在聊天编辑器中添加一个专用的麦克风 / 语音转文字按钮,而不是重用或改造“发送”按钮。 编辑器应保留现有的“发送”操作作为一个单独的控件。 概念上:

+----------------------------------------------------------------------------+
| [展开] [搜索] [终端] [附件] [麦克风] [代理 / 聊天] [↑] |
+----------------------------------------------------------------------------+

现有的麦克风录音实现应被重用,而不是创建第二个录音系统。
预期流程:
麦克风
    |
    v
录制音频
    |
    v
本地 / 配置的 STT 提供商
    |
    v
转录
    |
    +--> 插入到编辑器中
    |
    +--> 发送到当前的代理 / 聊天模型
用户应该能够在发送之前查看转录,同时还可以
…

内容来源: odysseus-dev/odysseus