--- description: >- 原生语音——语音转文字输入、文字转语音输出、吉祥物口型同步, 以及一个实时 Google Meet 智能体,能听会说。 icon: microphone --- # 语音 OpenHuman 在你需要时是语音优先的。STT、TTS 和实时 Google Meet 智能体是核心的一部分,而非第三方插件。 ## 语音转文字 * **热键**——按键说话和切换模式。 * **音频捕获**——跨平台麦克风捕获,带语音活动检测。 * **流式转录**——你说话时词语即时出现。 * **幻觉过滤器**——剥离已知人工产物("感谢观看"、静默诱导短语)。 * **后处理**——标点、大写、听写清理。 听写可以替换你桌面上活动的文本输入,或直接发送到与智能体的聊天中。 ## 文字转语音 回复语音通过托管 TTS 模型路由。智能体的回复可以用你选择的嗓音说出来,带自然的时机和韵律。语音选择可按用户配置,吉祥物头像通过 viseme 贴图与音频流口型同步。 ## 实时 Google Meet 智能体 OpenHuman 的旗舰语音集成: * 通过嵌入式 webview 加入 Google Meet。 * 实时流式输出音频到 STT,转录通话中的每个人,并在会议进行时将结构化笔记写入[记忆树](../obsidian-wiki/memory-tree.zh-CN.md)。 * 当你让它说话(或它觉得有需要补充的有用内容时),它通过 TTS 模型生成音频并**作为出站摄像头/麦克风流播放回会议**,这样其他参与者真的能听到它。 ## 隐私 * 音频捕获是本地的。流式 STT 通过 OpenHuman 后端;除实时转录外不保留任何录音。 * TTS 音频流式传输后丢弃——不存储。 * 会议转录内容会像其他来源一样落入你的本地记忆树中。 ## 另见 * [记忆树](../obsidian-wiki/memory-tree.zh-CN.md) —— Meet 转录和笔记存放的地方。 * [自动模型路由](../model-routing/) —— Meet 的大脑使用 `hint:fast` 实现低延迟对话轮次。