AI实时语音说明配置密钥、音色、角色,启停实时语音对话

返回导览说明: 《导览功能使用指南》· AI实时语音 · Navigation User Guide · AI Realtime Voice · English: AI Realtime Voice Guide

核心能力

相比普通语音对话,反应更快速,支持随身打断带有语气,更贴近真人对话。 语音唤醒后动作更流畅,可执行握手向前走 / 向后走左转 / 右转等移动,以及各类表演动作。 同时支持多国语言混合对话,无需停止对话再切换语言。 开启相机推流后,可实时分析前方场景

本功能与导览页「语音对话」相互独立。使用 AI 实时语音前,请先准备好 API Key(获取方式见文末「注册流程」),再完成页面内配置。

1. 功能概述

项目 说明
密钥 API 密钥(在配置弹窗中填写)
可配置项 API 密钥、音色、角色设定、相机推流开关
运行控制 启动 / 停止实时语音服务
对话展示 页面实时显示最新「问题 / 回复」

注意:请确保机器人在线,且网络畅通。API 密钥无效或服务不可用时,启动可能失败或无法正常对话。

2. 入口与页面说明

  1. 进入入口:在导览主界面,找到并点击 AI实时语音 按钮,进入本功能页面。
  2. 页面组成
    • 顶部状态区:显示「已启动 / 未启动」,以及相机启用状态
    • 最新对话区:展示当前问题与 AI 回复
    • 运行控制区:启动、停止、配置按钮
导览页入口:AI实时语音按钮
图 1:导览主界面入口(点击「AI实时语音」)
AI实时语音主界面
图 2:AI实时语音主界面(状态、对话、控制区)

3. 配置密钥 / 音色 / 角色

首次使用请先完成配置。点击运行控制区的 配置 按钮,打开配置弹窗。若还没有 API Key,请参见文末「注册流程」获取后粘贴。

3.1 API 密钥

  1. 在「API密钥」输入框中填写有效的 API 密钥
  2. 可点击右侧眼睛图标显示/隐藏密钥内容。
  3. 填写完成后需点击「保存配置」才会生效。

密钥请妥善保管,勿泄露给无关人员。

3.2 音色

  1. 点击「音色」一行,弹出音色选择器。
  2. 从列表中选择目标音色(默认推荐:甜甜 Tina)。
  3. 确认后返回配置弹窗,再点击「保存配置」。

支持多种中文、方言及多语种音色(如四川话、粤语、英文等),可按场景挑选。

3.3 角色设定

  1. 在「角色设定」文本框中填写角色提示词。
  2. 建议写清:机器人身份、回答风格、是否优先调用动作/移动等工具。
  3. 点击「保存配置」完成。

示例(可按实际场景修改):

你是成都鑫锋云科技有限公司的人形机器人助手,名字叫小峰。你可以通过工具控制自身移动和表演动作。
规则:
1. 用户询问你会做什么、有哪些动作时,必须调用 list_actions。
2. 用户要求前进/后退/左转/右转/停止移动时,必须调用对应移动工具,不要只口头答应。
3. 用户要求挥手、敬礼、跳舞、比心、握手等表演动作时,必须调用 execute_action。
4. 回答简洁友好,用中文。执行动作后用一句话确认即可。
配置弹窗:API密钥、音色、角色设定
图 3:配置弹窗(API密钥 / 音色 / 角色设定)
音色选择器
图 4:音色选择器

4. 相机开关

  1. 在页面顶部状态区,找到「相机:启用 / 禁用」开关。
  2. 打开后:启用相机推流,对话时可结合画面内容进行理解与回复。
  3. 关闭后:禁用相机推流,仅进行语音对话。如果是中途关闭,AI是根据看到的就是最后一帧画面,进行回复。

开关切换后会立即保存,无需再进入配置弹窗。

相机开关位置
图 5:顶部相机开关

5. 启动与停止

  1. 启动:确认已保存有效 API Key 后,点击 启动。等待约数秒,状态变为「已启动」即表示服务就绪。
  2. 对话:对着机器人说话即可。页面「最新对话」区域会同步显示问题与回复。
  3. 停止:点击 停止,状态变为「未启动」后服务结束。

提示:启动/停止过程中按钮会处于加载状态,请勿频繁连点。若启动失败,请检查脚本环境、网络连通性与 API Key 是否正确。

启动、停止、配置按钮
图 6:运行控制(启动 / 停止 / 配置)

6. 对话显示与常见问题

6.1 最新对话

页面中部「最新对话」会展示当前一轮交互:

  • 问题:用户语音识别结果
  • 回复:AI 实时语音回复文本

未开始对话时显示「暂无对话内容」。

最新对话展示
图 7:最新对话展示

6.2 常见问题

现象 可能原因与处理
启动失败 检查 API 密钥是否填写并已保存;确认机器人在线、网络畅通;必要时查看后端日志。
已启动但无回复 确认麦克风/扬声器正常;检查音色与角色设定是否保存成功;观察「最新对话」是否有识别文本。
无法执行动作/移动 确认角色设定中已要求调用对应工具;确认机器人动作/运动模块可用。
与导览「语音对话」冲突 两者相互独立。建议同一时间只运行一种语音通道,避免抢占麦克风或造成混乱。

7. AI实时语音 Key(千问 API Key)注册流程

使用本功能前,需先获取可用的 API Key。请按以下步骤完成注册与创建。

第一步:注册阿里云账号并完成实名认证

  1. 打开阿里云账号注册页面:
  1. 按页面提示完成账号注册。
  2. 登录后完成实名认证(个人或企业均可)。未实名通常无法正常开通与调用相关服务。实名认证入口:
注册阿里云账号并实名认证
图 8:注册阿里云账号并完成实名认证

第二步:创建 API Key

  1. 登录后进入阿里云百炼控制台(大模型服务平台):
  1. 若首次进入,按页面提示开通百炼 / 模型调用服务,并同意相关协议。
  2. 在页面右上角选择地域,建议选择 华北2(北京)
  3. 进入 API Key 管理页面,点击 创建 API Key
  4. 在弹窗中建议按如下设置:
    • 归属业务空间:默认业务空间
    • 描述:可选,例如填写「AI实时语音」
    • 权限:建议选择「全部」
  5. 点击确定后,立即复制并妥善保存完整 API Key(通常以 sk- 开头)。关闭弹窗后一般无法再次查看完整明文,丢失需重置或新建。
进入百炼控制台 API Key 页面
图 9:进入 API Key 管理页面
创建 API Key 弹窗
图 10:创建 API Key
复制并保存 API Key
图 11:复制并保存 API Key

注意:API Key 等同于调用凭证,请勿泄露、截图外传或提交到公开代码仓库。获取后请回到本系统「AI实时语音 → 配置」中粘贴并保存。

官方说明可参考:如何获取 API Key(阿里云帮助中心)