# 电脑模拟版智能音箱 ## 目标 在电脑上跑通"录音→ASR→LLM→TTS→播放"完整流程,0 成本、0 等待。 ## 硬件需求 - ✅ 电脑(你已经有了) - ✅ 麦克风(笔记本内置) - ✅ 音响 / 耳机(笔记本内置) ## 软件依赖 ```bash pip install -r requirements.txt ``` ## 快速开始 ### 1. 配置 API Key ```bash cp .env.example .env # 编辑 .env,填入你的 API Key ``` ### 2. 启动 TTS 服务 确保你的 TTS 服务在 `http://localhost:3000` 运行(或修改 .env)。 ### 3. 运行主程序 ```bash python main.py ``` ### 4. 操作流程 ``` [启动] → 按回车 → 开始录音 → 说一句话 → 自动停止 → [显示识别结果] → [显示 LLM 回复] → [听到 TTS 播放] ``` ## 文件说明 | 文件 | 作用 | |------|------| | `main.py` | 主程序,串联所有模块 | | `config.py` | 配置管理(API Key、服务地址) | | `recorder.py` | 录音模块(电脑麦克风) | | `asr.py` | 语音识别(云端 API) | | `llm.py` | 大模型对话(云端 API) | | `tts_client.py` | TTS 客户端(调你的服务)⭐ | | `player.py` | 音频播放模块 | ## API 配置 ### ASR(语音识别) 推荐选项: - **OpenAI Whisper API**(最简单,¥0.006/分钟) - 阿里达摩院 Paraformer(中文更准) - 本地 Whisper.cpp(免费但需要配置) ### LLM(大模型) 推荐选项: - **DeepSeek**(便宜,¥1/百万 token) - OpenAI GPT-4o(贵但强) - 通义千问 Qwen(中文好) - Ollama 本地(免费但慢) ### TTS(你的服务)⭐ 调本地服务: ```bash # 你的项目跑起来后 # 默认 http://localhost:3000 ``` ## 调试技巧 ### 1. 单独测试每个模块 ```bash python recorder.py # 测试录音 python asr.py # 测试 ASR python llm.py # 测试 LLM python tts_client.py # 测试 TTS python player.py # 测试播放 ``` ### 2. 查看日志 每个模块都有详细日志,能看出哪一步出错。 ### 3. 常见问题 | 问题 | 解决 | |------|------| | 麦克风没声音 | 检查系统权限 | | API Key 无效 | 检查 .env 配置 | | TTS 服务连接失败 | 确认服务已启动 | | 播放没声音 | 检查音量、输出设备 | ## 下一步 跑通电脑模拟版后: 1. 录制 3 分钟演示视频 2. 决定是否买树莓派做硬件原型 3. 联系潜在客户 --- **预计时间**:1-2 天 **预计成本**:0 元