# AI Agent 设计方案 ## 一、Agent 架构 ``` 用户输入 ↓ LLM (GPT-4 / Claude / 通义) ↓ 意图理解 → 工具调用决策 ↓ 调用 TTS API(detect_voice / synthesize_*) ↓ 处理结果 → 自然语言回复 ↓ 返回音频 URL + 建议 ``` ## 二、三层 Agent 能力 ### Level 1:被动响应 用户:帮我把这段话配音 Agent:调用 synthesize,返回音频 ### Level 2:主动建议 用户:帮我把这段话配音 Agent:请问用途?我推荐磁性男声 + happy 情感 + 1.1 倍语速,确认开始生成? ### Level 3:学习个性化 用户:帮我配音(已是第 50 次使用) Agent:根据您的偏好(短视频场景、磁性男声、1.1 倍速)开始生成... ## 三、用户偏好模型 接口:UserPreferences 字段: - userId:用户 ID - voicePreferences: - favoriteVoices:常用音色列表 - defaultEmotion:默认情感 - defaultSpeed:默认语速 - usagePatterns: - primaryUseCase:主要用途 - averageTextLength:平均文本长度 - activeHours:活跃时段 - historicalChoices:历史选择记录 ## 四、工作流编排 ### 工作流 1:智能配音助手 输入:用户文本 + 自然语言描述 步骤: 1. 解析用户意图(场景 + 风格) 2. 调用 detect_voice 获取推荐 3. 询问用户确认 4. 调用对应 synthesize 接口 5. 返回音频 + 使用建议 适用:所有配音场景 ### 工作流 2:批量有声书生成 输入:整本小说(多章节) 步骤: 1. 拆分章节 2. 为每章调用 async-synthesize 3. 收集所有 task_id 4. 轮询或等待回调 5. 合并为完整有声书 6. 返回完整文件 适用:有声书制作 ### 工作流 3:视频自动配音 输入:视频文件 步骤: 1. 提取视频中的文案 2. 拆分短句 3. 逐句调用 synthesize_short 4. 对齐视频时间线 5. 合成最终视频 适用:自媒体视频 ## 五、商业模式 ### 免费层 - 每月 10000 字符 - 标准音色 - 基础参数调整 ### 付费层 - 无限字符 - 全部音色(含定制) - 高级参数(情感、语速、音调) - 优先队列 ### 企业层 - 私有部署 - 定制音色 - SLA 保障 - 专属客服 ## 六、实施路线图 ### Week 1:MVP - 注册 Coze 开发者账号 - 上传 skill.json - 实现 /v1/tts/* 6 个端点 - 在 Coze 工作台测试 ### Week 2:优化 - 收集测试反馈 - 优化 system prompt - 增加使用示例 - 提交审核上架 ### Week 3-4:扩展 - 复制到 Dify、GPTs、豆包 - 训练用户偏好模型 - 接入更多音色 ### Month 2+:生态 - 接入剪映/CapCut 插件市场 - 接入小红书编辑器 - 接入抖音创作工具 - 形成 AI 生态矩阵