功能特性
语音识别(支持14种语言)
本工具的语音识别功能支持14种主流语言,覆盖了全球大部分地区的使用需求。支持的语言包括:中文(普通话)、英文(美国英语)、日文、韩文、法语、德语、西班牙语、西班牙语(拉丁美洲)、葡萄牙语(巴西)、葡萄牙语(葡萄牙)、俄语、阿拉伯语、印地语、意大利语、荷兰语和波兰语。用户只需在识别前从语言下拉菜单中选择对应的语言,工具就会自动配置相应的语音识别引擎。识别引擎由浏览器提供,使用的是云端识别服务,能够提供高精度的语音转文字能力。
语音合成(多声音可选)
语音合成功能可以将用户输入的文本转换为自然流畅的语音。浏览器会根据系统安装的语音包提供多个可选声音,包括不同性别、不同语言的语音。用户可以自由选择最适合的声音进行朗读。声音选择列表会实时根据当前选择的语言进行筛选,只显示支持该语言的声音选项,简化了选择过程。不同浏览器和操作系统提供的声音数量和质量可能有所不同。
语速、音调、音量调节
语音合成提供了三个核心参数的精细调节功能。语速调节范围从0.5到2.0,以0.1为步进单位,允许用户根据需要选择极慢的详细朗读或较快的快速浏览。音调调节范围同样从0.5到2.0,可以模拟从低沉浑厚到高亢清脆的不同声音效果。音量调节范围从0到1.0,支持从完全静音到最大音量的全范围调节。每个参数都配有直观的滑块控件,用户可以实时预览调节效果。
持续识别与单次识别
工具提供两种语音识别模式。持续识别模式会保持麦克风始终处于监听状态,用户可以连续不断地说话,识别结果会持续更新在显示区域中。这种模式适合需要进行长时间语音输入的场景。单次识别模式在检测到用户说完整一句话后会自动停止录音,适合需要精确控制识别时机的场景。用户可以在两种模式之间自由切换,以适应不同的使用需求。
识别结果实时显示
在语音识别过程中,识别结果会实时显示在界面上。对于正在进行的识别,会显示当前正在处理的文本(可能包含临时结果);对于已完成的识别,会以历史记录的形式保存在列表中,每条记录都标注了识别的时间戳。用户可以清晰地看到整个识别过程的演变,也可以方便地浏览和管理历史识别结果。
发送到合成
工具内置了便捷的"发送到合成"功能。当用户在语音识别区域获得了一段文字后,只需点击发送按钮,该段文字就会自动填充到语音合成区域的文本框中,用户无需手动复制粘贴。这个功能使得语音识别和语音合成之间形成了一个完整的工作流程闭环,非常适合进行语音到语音的转换测试或语言学习场景。
5个预设文本
为了方便用户快速测试语音合成功能,工具内置了5个精心设计的预设文本。英文问候语测试日常对话场景的英文合成效果;中文问候语测试中文语音的自然度和流畅性;英文绕口令测试语音合成对复杂音节组合的处理能力;中文绕口令检验中文语音的声调准确性和连读效果;文学经典片段则展示了长文本和复杂句式的朗读效果。用户只需点击对应的预设按钮,文本就会自动填入合成输入框并开始朗读。
声音按语言筛选
当系统中安装了多种语言的语音包时,声音列表可能会非常长。工具提供了声音按语言筛选功能,用户在选择了目标语言后,声音下拉列表会自动过滤,只显示支持该语言的声音选项。例如选择中文后,列表中只会显示中文语音包,避免了在大量无关选项中反复查找的困扰,大大提升了操作效率。
UD5工具箱