AGENT_DESIGN.md 2.7 KB

AI Agent 设计方案

一、Agent 架构

用户输入
    ↓
LLM (GPT-4 / Claude / 通义)
    ↓
意图理解 → 工具调用决策
    ↓
调用 TTS API(detect_voice / synthesize_*)
    ↓
处理结果 → 自然语言回复
    ↓
返回音频 URL + 建议

二、三层 Agent 能力

Level 1:被动响应

用户:帮我把这段话配音 Agent:调用 synthesize,返回音频

Level 2:主动建议

用户:帮我把这段话配音 Agent:请问用途?我推荐磁性男声 + happy 情感 + 1.1 倍语速,确认开始生成?

Level 3:学习个性化

用户:帮我配音(已是第 50 次使用) Agent:根据您的偏好(短视频场景、磁性男声、1.1 倍速)开始生成...

三、用户偏好模型

接口:UserPreferences

字段:

  • userId:用户 ID
  • voicePreferences:
    • favoriteVoices:常用音色列表
    • defaultEmotion:默认情感
    • defaultSpeed:默认语速
  • usagePatterns:
    • primaryUseCase:主要用途
    • averageTextLength:平均文本长度
    • activeHours:活跃时段
  • historicalChoices:历史选择记录

四、工作流编排

工作流 1:智能配音助手

输入:用户文本 + 自然语言描述 步骤:

  1. 解析用户意图(场景 + 风格)
  2. 调用 detect_voice 获取推荐
  3. 询问用户确认
  4. 调用对应 synthesize 接口
  5. 返回音频 + 使用建议

适用:所有配音场景

工作流 2:批量有声书生成

输入:整本小说(多章节) 步骤:

  1. 拆分章节
  2. 为每章调用 async-synthesize
  3. 收集所有 task_id
  4. 轮询或等待回调
  5. 合并为完整有声书
  6. 返回完整文件

适用:有声书制作

工作流 3:视频自动配音

输入:视频文件 步骤:

  1. 提取视频中的文案
  2. 拆分短句
  3. 逐句调用 synthesize_short
  4. 对齐视频时间线
  5. 合成最终视频

适用:自媒体视频

五、商业模式

免费层

  • 每月 10000 字符
  • 标准音色
  • 基础参数调整

付费层

  • 无限字符
  • 全部音色(含定制)
  • 高级参数(情感、语速、音调)
  • 优先队列

企业层

  • 私有部署
  • 定制音色
  • SLA 保障
  • 专属客服

六、实施路线图

Week 1:MVP

  • 注册 Coze 开发者账号
  • 上传 skill.json
  • 实现 /v1/tts/* 6 个端点
  • 在 Coze 工作台测试

Week 2:优化

  • 收集测试反馈
  • 优化 system prompt
  • 增加使用示例
  • 提交审核上架

Week 3-4:扩展

  • 复制到 Dify、GPTs、豆包
  • 训练用户偏好模型
  • 接入更多音色

Month 2+:生态

  • 接入剪映/CapCut 插件市场
  • 接入小红书编辑器
  • 接入抖音创作工具
  • 形成 AI 生态矩阵