Kotonia
ログイン今すぐ始める

CHARACTER VOICE CHAT

免费 AI 角色语音聊天

可以从公开角色中选择对话对象,用文字与语音实时交流。支持中文 / 日语 / 英语的语音引擎和口型同步头像展示。

口型同步头像示例展示
SPEAKING

你好,今天有什么可以帮你的吗?

中文 / VoxCPM2 · Ditto 口型同步

语音 + AI 实时构建的角色扮演环境

Kotonia 的角色语音聊天基于 VAD + STT + LLM + TTS 的实时管线。对着麦克风说话,AI 会立即以语音回应,已注册头像的角色还会做口型同步。适合语言练习、角色扮演、闲聊、情感陪伴 — 用语音培育关系。

11 种语言多语言 TTS
免费档每天 100 轮
口型同步头像同步展示

实时多语言语音对话

支持中、日、英等语言的高品质多语言 TTS (VoxCPM2)。开口说话,STT → AI → TTS 的管线即时回应。

公开角色与自创角色

可以与其他用户公开的角色对话。也可以保存并养成自己的角色。

口型同步头像展示

为角色注册头像图片后,Ditto 会让角色的嘴部动作与合成语音实时同步。

带历史的持续对话

按会话保存历史,可参考过往内容延续关系。

还能自动网络搜索与执行代码

遇到难题或需要最新信息时,角色会在后台自动进行网络搜索或执行代码后再回答。同时支持图像/视频生成,以及摄像头/屏幕共享的 Vision 功能。

语言学习伙伴角色扮演对话闲聊对象情感陪伴 AI语音输入草稿演讲练习

基本使用方法

1

选择角色

从公开角色中挑选 — 语言讲师、闲聊伙伴、角色扮演角色等多种。

2

允许使用麦克风

首次使用时浏览器会请求麦克风权限。授权后下次起一键即可开始。

3

对着麦克风说话

按下麦克风按钮开口说话。VAD 自动检测发言结束,AI 即时以语音回应。

4

通过历史延续关系

对话按会话自动保存。下次继续时 AI 会参考之前的内容,让关系慢慢培养。

各项设置的作用

面板分为「模式」「角色」「长期记忆」「详细设置」四个标签,每个标签内部又分成若干设置组。为了让你看清「哪个设置组里的哪个功能」,请点开下方的标签查看(顺序与实际面板一致)。拿不准时保持默认即可。

如何打开设置面板

点击角色聊天界面右上角的齿轮图标(⚙)即可打开此设置面板。旁边的「?」是帮助(使用指南)。

Kotona
※ 实际界面的示意图(仅供参考)点击这里
模式 标签切换对话中行为的主标签
会话
静音 / 取消静音
停止或恢复 AI 语音的播放。想只看文字时使用,例如深夜或在公共场所。
历史
打开过往对话会话的列表,从上次的地方继续。
清空对话
重置当前对话,从头开始。
LLM 档位
档位(Basic / Standard / Premium)
选择生成回复的 AI 模型档位。Basic 免费、本地、最快;Standard 是性价比高的云端模型;Premium 可自由选择顶级模型(Grok / Gemini / GPT / DeepSeek 等)。拿不准时用 Basic 就够了。情感细腻或复杂话题用 Standard 以上更有优势。Premium 需付费方案,或在为自建角色指定模型时使用。
选择模型
选择 Premium 时出现,从顶级模型列表中挑选要使用的模型。
自定义模型 ID
用 ID 直接指定列表中没有的模型(可选,面向高级用户)。
模式
实时
开启后,AI 说话过程中你也能插话打断(barge-in);关闭时则等 AI 说完再开口。想要自然的对话节奏时开启。
视觉
开启后,把摄像头或屏幕共享的画面展示给 AI,让它能聊你看到的内容;同时会出现输入源、发送尺寸、观察间隔。输入源在摄像头与屏幕之间切换。发送尺寸(320×180〜1280×720)越高越清晰,但流量和负载也随之增加(通常 640×360 已足够)。观察间隔(3〜30 秒)是回到空闲状态后隔多久看一次画面。
主动搭话
开启后,即使你不出声,AI 也会主动开口。用间隔(5〜60 秒)调整频率。朗读、独白、闲聊等行为请在系统提示中指定。仅在开启麦克风后生效。
头像
开启后,用 Ditto 让一张已注册的图片对口型,使嘴部随语音同步动作。通过角色图片上的心形图标注册「Ditto 源」即可使用。免费档头像每天 12 轮,超出后对话以普通语音继续。
智能代理
开启后,遇到难题或需要查资料时,会先在后台联网搜索或执行代码再回答;关闭时则只是普通对话。
描写
开启后,角色回复中会穿插旁白(*描写*)。旁白仅显示在屏幕上,不会朗读(TTS)。适合小说风格的角色扮演。
触感
开启后,可连接 Lovense 兼容设备,让角色配合对话节奏进行控制。需聊天套餐及以上方可使用。用 Lovense Connect / Remote 应用扫描二维码即可配对。没有设备时保持关闭即可。
图像生成模型
图像生成模型
选择是否在对话中生成图像(「无」或「本地 GPU(HiDream)」)。LoRA 堆叠可添加画风。留空时由 LLM 动态选择(默认 kotonia03);选中后则始终套用该堆叠。权重(0〜1.5)调节强度。
视频生成模型
视频生成模型
选择是否从已注册图片生成短视频(「无」或「WAN 2.5(图像→视频)」),并可设置分辨率(480p / 720p / 1080p)与时长(3〜10 秒)。以对话中「最新的图片」为基础生成。
角色 标签仅在使用自建角色时显示
资料
名称 / 用途 / 简介 / 标签
设置角色的基本信息,公开后用于列表与排行榜展示。
开场白 / 起始场景 / 回复候选
设置对话入口的呈现:打开时角色说的第一句、起始场景,以及最初的回复按钮。
公开与媒体
公开时的计费
选择他人使用你公开的角色时的计费方式(免费 / 按消息计费 / 仅订阅)。
媒体
统一管理表情差分图片上传、Ditto 源注册,以及从图片生成视频。
长期记忆 标签跨对话保留的备注
通用 / 按角色 的长期记忆
AI 跨对话参考的备注。通用适用于所有角色;按角色仅在与该角色的对话中参考。把你的名字、喜好、过往经历记下来,下次再来时就会有「记得你」的体验。
详细设置 标签语音识别(STT)与朗读(TTS)的内部设置
系统提示
设置给 AI 的指令。留空则使用默认。可自由填写角色的语气、身份、禁忌等。
语音识别(STT)
语言
选择识别与朗读的基准语言(日语 / English / 中文 / 多语言 auto)。多语言会在识别时自动检测语言,并由 VoxCPM2 合成多语言文本。
STT 模型
选择把语音转成文字的引擎。Whisper 通用且可选尺寸;Qwen3-ASR 精度高(推荐 GPU、首次加载较重);平假名是仅限日语的轻量识别。Whisper 尺寸(tiny〜large-v3)越大越准,但更慢、占用更多显存。GPU 建议 small〜medium,CPU 建议 tiny〜base。
Gemini 原始音频输入
开启后,除文字转写外,还会把原始音频本身一并发送给 Gemini,以保留发音与语调的细节。仅在选择 Gemini 系模型时生效。
朗读(TTS)
TTS 引擎
选择把回复转成语音的方式。WebSpeech 为浏览器内置、轻量;VoiceVox 为日语动漫风;AivisSpeech 情感丰富;VoxCPM2 支持多语言音色设计与声音克隆;Irodori 可用文字描述音色。Irodori 通过在「VoiceDesign 描述」里写下想要的声音氛围来控制。用 🎲 摇到喜欢的声音后固定「音色种子」,音色每次都会保持一致。
朗读速度
调整说话的速度(0.5〜2.0 倍)。

对话示例

选择角色,对着麦克风讲话,AI 即以语音回应。注册头像后还能做口型同步。

今天当我的英语练习伙伴吧,我即将有一场英语面试。
角色: Ryan (英语讲师)
Ryan
Sure! Let's start with the classic question. Tell me about yourself — in 30 seconds.
语言: English / TTS: VoxCPM2
I'm a software engineer with five years of experience...
Ryan
Great opening. Try not to start every sentence with "I" — switch it up. Want me to give you a corrected version?
发音 + 语法反馈

支持的语音语言

以中日英为主,支持多语言语音输入输出 (VoxCPM2)。可按角色切换语言。

日本語 (JP)English (EN)中文 (ZH)粤語 (YUE)한국어 (KO)Español (ES)Français (FR)Deutsch (DE)Italiano (IT)Português (PT)Русский (RU)

与其他功能联动

角色语音聊天与 Kotonia 其他功能组合更强大。从公开角色库选择对话对象,或体验傲娇 AI 英语会话等特定打包产品。

立即免费试用语音聊天

1 分钟注册,无需信用卡。免费档每天可使用 100 轮多语言语音对话。