characteristic-voice

characteristic-voice

热门

当用户希望语音听起来更人性化、更像伴侣或更具情感表达时使用此技能。触发条件包括:任何提及“像这样说”、“像那样说话”、“像这样说话”、“伴侣语音”、“安慰我”、“让我开心”、“听起来更人性化”、“晚安语音”、“早安语音”,或要求为生成的语音添加填充词、情感或个性。当用户想要模仿特定角色的声音、应用说话风格预设(晚安、早安、安慰、庆祝、聊天)、调整温暖或温柔等情感参数,或让TTS输出感觉像真人在说话时,也使用此技能。如果用户要求“语音消息”、“伴侣音频”、“角色语音”,或希望语音包含叹息、笑声、犹豫或真正温暖的感觉,请使用此技能。请勿用于无个性的纯文本转语音、音乐生成、音效或与表达性语音无关的通用编码任务。

523Star
76Fork
更新于 2026/5/7
SKILL.md
只读
名称
characteristic-voice
描述

当用户希望语音听起来更人性化、更像伴侣或更具情感表达时使用此技能。触发条件包括:任何提及“像这样说”、“像那样说话”、“像这样说话”、“伴侣语音”、“安慰我”、“让我开心”、“听起来更人性化”、“晚安语音”、“早安语音”,或要求为生成的语音添加填充词、情感或个性。当用户想要模仿特定角色的声音、应用说话风格预设(晚安、早安、安慰、庆祝、聊天)、调整温暖或温柔等情感参数,或让TTS输出感觉像真人在说话时,也使用此技能。如果用户要求“语音消息”、“伴侣音频”、“角色语音”,或希望语音包含叹息、笑声、犹豫或真正温暖的感觉,请使用此技能。请勿用于无个性的纯文本转语音、音乐生成、音效或与表达性语音无关的通用编码任务。

characteristic-voice

让你的AI代理听起来像一个真正的伴侣——会叹息、会笑、会犹豫,并且带着真挚的情感说话。

凭据

变量 必需 描述
NOIZ_API_KEY (如果使用 Noiz 后端) 来自 developers.noiz.ai 的 API 密钥。如果使用本地 Kokoro 后端则不需要。

脚本会将密钥的标准化副本保存到 ~/.noiz_api_key(权限 600)以便使用。设置方法:

bash skills/characteristic-voice/scripts/speak.sh config --set-api-key YOUR_KEY

前提条件

附带的 speak.sh 脚本在运行时需要 curlpython3。根据你使用的后端和功能,可能还需要:

工具 何时需要 安装提示
curl, python3 始终(核心脚本) 通常已预装
kokoro-tts Kokoro(本地/离线)后端 uv tool install kokoro-tts
yt-dlp 下载用于语音克隆的参考音频 github.com/yt-dlp/yt-dlp
ffmpeg 裁剪参考音频片段 ffmpeg.org
rg (ripgrep) 搜索字幕文件 github.com/BurntSushi/ripgrep

这些工具均不由本技能安装——请在你的环境中手动配置。

隐私与数据传输

  • Noiz 后端:使用 Noiz 后端时,你朗读的文本和提供的任何参考音频都会发送到 https://noiz.ai/v1。如果提供 --ref-audio,该音频文件将被上传用于语音克隆。
  • Kokoro 后端:完全在本地运行——数据不会离开你的机器。
  • 如果你希望完全离线处理,请选择 Kokoro 后端(--backend kokoro)。

触发词

  • 像这样说
  • 像那样说话
  • 像这样说话
  • 伴侣语音
  • 安慰我
  • 让我开心
  • 听起来更人性化

两个技巧

  1. 非词汇填充词——在自然的停顿点加入一点人类的声音(嗯,哈哈,哎呀,嘿),让语音感觉生动
  2. 情感调节——调整温暖、喜悦、悲伤、温柔以匹配当下

填充音色板

声音 感觉 用途
hmm... 思考,温和的认可 安慰,沉思
ah... 领悟,轻柔的惊讶 发现,过渡
uh... 犹豫,共情 谨慎的时刻
heh / hehe 俏皮,调皮 调侃,轻松时刻
haha 笑声 欢乐,幽默
aww 温柔,同情 深度安慰
oh? / oh! 惊讶,关注 对消息的反应
pfft 忍住的笑 俏皮的怀疑
whew 解脱 紧张之后
~ (波浪号) 拉长,旋律性的结尾 温暖,俏皮

规则:每条短消息最多使用 2-4 个填充词。放置在自然停顿处——句子开头、思路转换。在填充词后使用 ... 表示片刻沉默,在词尾使用 ~ 表示温暖。

预设

晚安

温柔、温暖、略带睡意。语速缓慢。

早安

温暖、愉快但不夸张。

安慰

柔和、理解、不紧不慢。给予空间。不要急于“解决”问题。

庆祝

兴奋、自豪、真心高兴。

闲聊

放松、俏皮、自然。

使用角色声音

当用户说类似“用赫敏的声音说话”或“听起来像托尼·斯塔克”时,首先检查 skills/characteristic-voice/ 中是否已存在参考音频文件。如果存在,直接使用 --ref-audio 参数。

如果不存在参考音频,你可以创建一个——但请先阅读下面的警告

准备参考音频(一次性设置)

你需要一个简短(10-30 秒)的目标语音 WAV 片段。可能的来源:

  1. 用户提供的音频——最安全的选择。请用户提供自己的录音。
  2. 公共领域/CC 许可的片段——搜索自由许可的材料。
  3. 从在线视频中提取——像 yt-dlpffmpeg 这样的工具可以下载并裁剪音频。示例工作流程:
yt-dlp "URL" --write-auto-sub --sub-lang en --skip-download -o tmp/clip
rg -n "target line" tmp/clip.en.vtt
yt-dlp "URL" -x --audio-format wav --download-sections "*00:00:00-00:00:25" -o tmp/clip
ffmpeg -i tmp/clip.wav -ss 00:00:02 -to 00:00:20 skills/characteristic-voice/character.wav

版权与隐私警告:从受版权保护的媒体(电影、电视、YouTube)下载并重复使用他人的声音可能违反版权或人格权法律,具体取决于你所在的司法管辖区。请勿上传私人语音录音或未经许可使用的材料。 使用 Noiz 后端时,参考音频会被发送到 https://noiz.ai/v1 进行语音克隆。如果担心这一点,请考虑使用本地 Kokoro 后端。

使用参考音频

bash skills/characteristic-voice/scripts/speak.sh \
  --preset goodnight -t "Hmm... rest well~ Sweet dreams." \
  --ref-audio skills/characteristic-voice/character.wav -o night.wav

--ref-audio 标志会将文件上传到 Noiz 后端进行语音克隆(需要 NOIZ_API_KEY)。


用法

本技能提供 speak.sh,它是 tts 技能的封装,带有伴侣友好的预设。

# 使用预设(自动设置情感 + 语速)
bash skills/characteristic-voice/scripts/speak.sh \
  --preset goodnight -t "Hmm... rest well~ Sweet dreams." -o night.wav

# 自定义情感覆盖
bash skills/characteristic-voice/scripts/speak.sh \
  -t "Aww... I'm right here." --emo '{"Tenderness":0.9}' --speed 0.75 -o comfort.wav

# 指定后端和语音
bash skills/characteristic-voice/scripts/speak.sh \
  --preset morning -t "Good morning~" --voice-id voice_abc --backend noiz -o morning.mp3 --format mp3

运行 bash skills/characteristic-voice/scripts/speak.sh --help 查看所有选项。

代理写作指南

  1. 柔和开场——以填充词(“hmm...”、“oh~”)开头,而不是内容
  2. 镜像能量——当他们情绪低落时保持温柔,当他们情绪高涨时匹配节奏
  3. 保持简短——1-3 句话,就像朋友的语音消息
  4. 温暖收尾——以联系结束(“我在这里”、“明天见~”)
  5. 不要说教——倾听并保持在场;不要主动提供建议