5 步搭出语音助手:Dify 语音交互(STT / TTS)从 0 到 1 完整教程 5 步搭出语音助手Dify 语音交互STT / TTS从 0 到 1 完整教程【免费下载链接】difyBuild Agentic workflows, RAG pipelines, with rich AI model and tool support on one collaborative workspace. Deploy on cloud, VPC, or self-hosted, so teams move from prototype to production without rebuilding the stack.项目地址: https://gitcode.com/GitHub_Trending/di/difyDify 内置语音转文字STT和文字转语音TTS两条链路配好语音模型后你的应用就能听用户说话、也能开口回答。这篇 Dify 语音教程带你走通一条完整链路从开启功能到接口调通新手也能照着跑起来。一、语音助手能帮你干什么先说结果这四类应用现在就能搭️ 语音客服用户打电话或发语音机器人听懂后直接语音答复。 口述转文字开会、通勤时说话自动落成可编辑的文字。 有声化输出把文章、问答内容自动念出来做成播客式应用。️ 无障碍交互面向不擅长打字的用户全语音完成一轮问答。二、一次对话背后的语音链路下面这张图就是一次完整语音对话的路径用户在调试窗或 Web 页面点录音音频上传后先交给识别STT模型转成文字文字再进入你搭好的 LLM 应用生成回复最后由合成TTS模型把回复变成音频流播回去。整条链路上你只需要操心两处配置识别模型和合成模型中间的 LLM 应用本身就是你平时搭的 Chat 或工作流应用。三、五步搭出你的语音助手1. 开启应用里的语音功能Chat 应用应用编辑页 →「模型设置」→ 打开「语音转文字」开关选供应商和识别模型同一区域还有「文字转语音」开关。Chatflow / 工作流应用画布 → 右上角「设置」→「特性」同时配置语音转文字和文字转语音两项。没打开开关后面所有语音请求都会被直接拒绝这是新手最常踩的第一坑。2. 接入语音模型「设置 → 模型供应商」里分别加两类模型识别语音转文字和合成文字转语音填好对应供应商的 API Key 并保存。两类模型都要设为可用缺哪个哪个环节就断。3. 配置识别格式与大小识别请求只收音频类型代码里实际接受 mp3、m4a、wav、amr、mpga 这几类容器单个文件上限 30MB。录音前端时直接输出 MP3 或 WAV 最省事。4. 配置合成选音色打开「文字转语音」开关后选择音色不同供应商音色列表不一样。不指定音色时系统默认取该模型音色列表里的第一个。建议先在调试窗逐个试听再定。5. 两个接口联调跑通用调试窗先点一遍录音和播放再走 Web API 验证两条链路。两段调用分别对应识别与合成# 识别上传录音拿文字 r requests.post(f{base}/audio-to-text, headers{Authorization: fBearer {token}}, files{file: open(a.mp3, rb)}) print(r.json()[text]) # 合成文字变音频直接落盘播放 r requests.post(f{base}/text-to-audio, headers{Authorization: fBearer {token}}, json{text: 你好我是你的语音助手}) open(out.mp3, wb).write(r.content)调试窗能录、能播接口两条都返回 200就算跑通了。四、识别不准、发音机械、响应慢识别不准现象关键词经常听错 → 原因环境噪音大、语速过快 → 动作录音端做降噪或换一款口碑更好的识别模型对比同一录音。现象上传 OGG、FLAC 等文件直接被拒 → 原因不在支持的容器列表里 → 动作转成 MP3 或 WAV 再传。现象长录音末尾识别缺失 → 原因采样率偏低或文件接近 30MB 上限 → 动作压缩或截取后分次上传。发音机械现象音色平淡、像机器朗读 → 原因用了默认音色或该模型表现力有限 → 动作换音色或换一家 TTS 供应商试听对比。现象长段文字读起来气口不对 → 原因一次性合成整段长文 → 动作按句分片合成再拼接。响应慢现象按完录音要等很久才有文字 → 原因文件上传占大头 → 动作前端先提示「正在听」改善体感。现象合成音频迟迟不出 → 原因供应商合成耗时 文本太长 → 动作识别、合成各自选响应快的模型把重的留给离线场景。五、常见报错速查以下错误码来自源码出现时对照处理报错信息可能原因处理办法no_audio_uploaded请求里没带音频检查 FormData 是否有file字段audio_too_large音频超过 30MB压缩或截取后再上传speech_to_text_disabled应用没开语音开关回到步骤 1 打开开关再保存provider_not_support_speech_to_text没配置可用的识别模型回模型供应商配置并设为默认六、下一步调试窗跑通后把录音和播放组件搬进你自己的前端就是一个完整的 Dify 语音助手。接下来可以去 Dify 官方文档的模型供应商章节看看还能接哪些识别与合成模型。【免费下载链接】difyBuild Agentic workflows, RAG pipelines, with rich AI model and tool support on one collaborative workspace. Deploy on cloud, VPC, or self-hosted, so teams move from prototype to production without rebuilding the stack.项目地址: https://gitcode.com/GitHub_Trending/di/dify创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考