AI Agent 设计方案
一、Agent 架构
用户输入
↓
LLM (GPT-4 / Claude / 通义)
↓
意图理解 → 工具调用决策
↓
调用 TTS API(detect_voice / synthesize_*)
↓
处理结果 → 自然语言回复
↓
返回音频 URL + 建议
二、三层 Agent 能力
Level 1:被动响应
用户:帮我把这段话配音
Agent:调用 synthesize,返回音频
Level 2:主动建议
用户:帮我把这段话配音
Agent:请问用途?我推荐磁性男声 + happy 情感 + 1.1 倍语速,确认开始生成?
Level 3:学习个性化
用户:帮我配音(已是第 50 次使用)
Agent:根据您的偏好(短视频场景、磁性男声、1.1 倍速)开始生成...
三、用户偏好模型
接口:UserPreferences
字段:
- userId:用户 ID
- voicePreferences:
- favoriteVoices:常用音色列表
- defaultEmotion:默认情感
- defaultSpeed:默认语速
- usagePatterns:
- primaryUseCase:主要用途
- averageTextLength:平均文本长度
- activeHours:活跃时段
- historicalChoices:历史选择记录
四、工作流编排
工作流 1:智能配音助手
输入:用户文本 + 自然语言描述
步骤:
- 解析用户意图(场景 + 风格)
- 调用 detect_voice 获取推荐
- 询问用户确认
- 调用对应 synthesize 接口
- 返回音频 + 使用建议
适用:所有配音场景
工作流 2:批量有声书生成
输入:整本小说(多章节)
步骤:
- 拆分章节
- 为每章调用 async-synthesize
- 收集所有 task_id
- 轮询或等待回调
- 合并为完整有声书
- 返回完整文件
适用:有声书制作
工作流 3:视频自动配音
输入:视频文件
步骤:
- 提取视频中的文案
- 拆分短句
- 逐句调用 synthesize_short
- 对齐视频时间线
- 合成最终视频
适用:自媒体视频
五、商业模式
免费层
付费层
- 无限字符
- 全部音色(含定制)
- 高级参数(情感、语速、音调)
- 优先队列
企业层
六、实施路线图
Week 1:MVP
- 注册 Coze 开发者账号
- 上传 skill.json
- 实现 /v1/tts/* 6 个端点
- 在 Coze 工作台测试
Week 2:优化
- 收集测试反馈
- 优化 system prompt
- 增加使用示例
- 提交审核上架
Week 3-4:扩展
- 复制到 Dify、GPTs、豆包
- 训练用户偏好模型
- 接入更多音色
Month 2+:生态
- 接入剪映/CapCut 插件市场
- 接入小红书编辑器
- 接入抖音创作工具
- 形成 AI 生态矩阵