无需登录 数据私有 本地保存

Web Speech API 综合演示 - 识别与合成双向

26
0
0
0

语音识别 语音合成 — 体验 Web Speech API 的双向能力

语音识别
检测中...
语音合成
检测中...
👋 英文问候 🇨🇳 中文问候 🔤 英文绕口令 🐉 中文绕口令 🎭 文学经典
常见问题与知识点

Web Speech API 是浏览器内置的语音接口标准,包含两大核心能力:语音识别(Speech Recognition)——将语音实时转换为文字;语音合成(Speech Synthesis)——将文字转换为自然语音朗读。无需安装任何插件,现代浏览器即可使用。语音识别通常依赖云端服务(如Google的语音识别服务),而语音合成则结合本地系统声音引擎。

语音识别:Chrome(桌面+Android)完全支持;Edge 支持良好;Safari 从 iOS 14.5 / macOS 11.3 开始部分支持;Firefox 支持有限。语音识别通常需要 HTTPS 或 localhost 才能使用麦克风。
语音合成:几乎所有现代浏览器都支持,包括 Chrome、Firefox、Safari、Edge,兼容性非常好。不同浏览器和操作系统提供的声音列表有所不同。

在 Chrome 和大多数浏览器中,语音识别功能需要网络连接,因为音频数据会被发送到云端服务器进行处理和识别。如果您看到 "network" 错误,请检查网络连接。部分平台(如某些 Android 设备)可能支持离线识别,但这取决于系统和浏览器实现。

  • 选择正确的识别语言,匹配您说话的语言
  • 安静的环境中使用,减少背景噪音
  • 尽量使用外接麦克风而非内置麦克风
  • 说话时保持清晰、自然的语速
  • 开启「实时显示」模式可查看中间识别结果
  • 对于专业术语或特定词汇,识别准确率可能降低

语音合成支持的语言和声音取决于您的操作系统和浏览器。Windows 提供 Microsoft 声音包,macOS/iOS 提供 Apple 的高质量声音(如 Ting-Ting、Samantha 等),Chrome 还提供 Google 的云端声音。您可以在声音下拉列表中查看所有可用选项。

关于导出:Web Speech API 本身不直接支持导出音频文件。如需保存合成语音,可以使用系统录音工具、屏幕录制软件,或借助 Web Audio API 进行音频捕获(需要额外开发)。

Android Chrome:支持良好,但需要 HTTPS 连接。
iOS Safari:从 iOS 14.5 开始支持 SpeechRecognition,但需要用户手势触发,且可能受系统限制。实际体验因设备和系统版本而异。
移动端注意事项:屏幕锁定或切换到其他应用可能导致识别中断;建议保持屏幕常亮以获得最佳体验;移动端语音合成可能因系统休眠而暂停。

在 Chrome 等浏览器中,语音识别的音频数据会被发送到Google 的云端服务器进行处理。浏览器会在首次使用时请求麦克风权限,您可以随时在浏览器设置中撤销该权限。语音合成完全在本地执行,不会发送数据到外部服务器。对于敏感场景,建议确认浏览器隐私政策并谨慎使用语音识别功能。

常见错误及解决方案:
• not-allowed:用户拒绝了麦克风权限,请在浏览器设置中允许麦克风访问
• no-speech:未检测到语音输入,请检查麦克风是否正常工作
• network:网络连接问题,语音识别需要联网
• audio-capture:无法捕获音频,检查麦克风是否被其他应用占用
• 完全不支持:请使用最新版 Chrome 浏览器,并确保通过 HTTPS 访问(或 localhost 开发环境)