Kotonia
ログイン今すぐ始める

CHARACTER VOICE CHAT

AI キャラと音声で会話できる 無料チャット

公開ペルソナから相手を選んで、テキストと音声でリアルタイムに会話できます。日本語・英語・中国語の音声エンジンとリップシンクアバター表示に対応しています。

リップシンクアバターのサンプル表示
SPEAKING

こんにちは、今日はどうしましたか?

日本語 / VoxCPM2 · Ditto リップシンク

マイクと AI 音声だけで成り立つロールプレイ環境

Kotonia の AI キャラ音声チャットは、VAD + STT + LLM + TTS のリアルタイムパイプラインで動きます。マイクで話せば即座に AI が音声で返答し、対応するペルソナのリップシンクアバターも同期して動きます。語学学習・ロールプレイ・雑談・感情伴走など、声で関係性を育てる用途に最適化されています。

11 言語多言語 TTS 対応
無料枠あり1 日 100 往復
リップシンクアバター同期表示

多言語のリアルタイム音声会話

日本語・英語・中国語などに対応する高品質な多言語 TTS (VoxCPM2)。マイクで話せば即時に STT → AI 応答 → 音声合成で返ってきます。

公開ペルソナ + 自作ペルソナ

他のユーザーが公開したペルソナを選んで会話できます。自分のペルソナを保存して育てることもできます。

リップシンクアバター表示

ペルソナにアバター画像を登録すれば、Ditto によるリップシンクで音声に合わせて口の動きが同期します。

履歴付きの継続会話

セッション単位で会話履歴を保存し、過去のやりとりを参照しながら関係性を継続できます。

Web 検索・コード実行も自動で

難しい質問や最新情報が必要な場面では、キャラが裏で Web 検索やコード実行をしてから答えます。画像/動画生成やカメラ・画面共有 (Vision) にも対応。

語学学習パートナーロールプレイ会話雑談・話し相手感情伴走 AI音声入力ドラフトプレゼン練習相手

基本の使い方

1

ペルソナを選ぶ

公開ペルソナの中から相手を選択。語学講師、雑談相手、ロールプレイキャラなど多彩。

2

マイクを許可

初回はブラウザでマイクの使用許可を求められます。一度許可すれば以降はワンクリックで開始。

3

マイクで話しかける

マイクボタンを押して話すだけ。VAD が発話終了を自動検出し、AI が即座に音声で返答します。

4

履歴で関係性を継続

セッション単位で会話が自動保存。続きから話すと過去のやりとりを参照して関係性を育てられます。

各設定の役割

このパネルは「モード」「キャラクター」「長期記憶」「詳細設定」の 4 タブに分かれ、各タブの中がさらにいくつかの設定グループに分かれています。「どの設定グループの、どの機能か」がわかるように、下のタブをタップして中を開いてください(並びは実際のパネルと同じ順です)。迷ったら初期値のままで問題ありません。

設定パネルの開き方

キャラチャットの画面右上にある歯車アイコン(⚙)をタップすると、この設定パネルが開きます。左どなりの「?」はヘルプ(使い方ガイド)です。

ことな
※ 実際の画面の再現イメージ(参考)ここをタップ
モード タブ会話中の振る舞いを切り替える基本タブ
会話
音声オフ / 音声オン
AI の音声再生を止めたり、元に戻したりします。声を出さずテキストだけで読みたいとき、深夜や外出先などで使います。
履歴
過去の会話セッションの一覧を開き、続きから再開します。
会話をクリア
表示中の会話をリセットして、最初から話し直します。
LLM ティア
ティア(Basic / Standard / Premium)
AI モデルの階層を選びます。Basic は無料・ローカルで最速、Standard はコスパ重視のクラウド、Premium は最高峰モデル(Grok / Gemini / GPT / DeepSeek など)を自由に選べます。迷ったら Basic で十分です。感情の機微や複雑な相談は Standard 以上が向いています。Premium は有料プラン、または自作キャラのモデルを指定するときに使います。
モデルを選択
Premium を選んだときに現れ、フロンティアモデルの一覧から使うモデルを選びます。
カスタムモデル ID
一覧にないモデルを ID で直接指定します(任意・上級者向け)。
モード
リアルタイム
ON にすると、AI が話している最中でも割り込んで話しかけられます(バージイン)。OFF では、AI が話し終わるのを待ってから話します。自然な会話のテンポにしたいときは ON にします。
ビジョン
ON にすると、カメラや画面共有の映像を AI に見せて、見えているものについて話せます。入力ソース・送信サイズ・観察間隔もあわせて表示されます。入力ソースはカメラと画面共有を切り替えます。送信サイズ(320×180〜1280×720)は高いほど鮮明になりますが、通信量と負荷も増えます(通常は 640×360 で十分です)。観察間隔(3〜30秒)は、待機状態に戻ってから画面を見るまでの待ち時間です。
自動話しかけ
ON にすると、ユーザーが黙っていても AI から話しかけます。間隔(5〜60秒)で頻度を調整できます。読み聞かせ・独白・雑談などの振る舞いは、システムプロンプトで指定します。マイクを開始したあとにだけ動作します。
アバター
ON にすると、登録した画像 1 枚を Ditto でリップシンクさせ、音声に合わせて口が動くアバターを表示します。ペルソナ画像のハートアイコンから「Ditto ソース」を登録すると使えます。無料枠はアバター 1 日 12 往復までで、超過後は通常の音声のまま会話が続きます。
エージェント
ON にすると、難しい質問や調べ物は、裏で Web 検索やコード実行をしてから答えます。OFF では、通常の会話だけになります。
描写
ON にすると、キャラの応答に地の文(*描写*)が混ざります。地の文は画面に表示されるだけで、音声(TTS)には乗りません。小説のようなロールプレイに向いています。
触覚
ON にすると、Lovense 対応デバイスと連携し、会話の流れに合わせてキャラが動かします。チャットプラン以上でご利用いただけます。Lovense Connect / Remote アプリで QR コードを読み取って接続します。デバイスをお持ちでない場合は OFF のままで問題ありません。
画像生成モデル
画像生成モデル
会話の流れで画像を生成するかを選びます(「なし」または「ローカル GPU(HiDream)」)。LoRA スタックで画風を追加できます。空欄のときは LLM が自動で選びます(既定は kotonia03)。選択すると常にそのスタックが当たります。weight(0〜1.5)で効き具合を調整します。
動画生成モデル
動画生成モデル
登録画像から短い動画を生成するかを選びます(「なし」または「WAN 2.5(画像→動画)」)。解像度(480p / 720p / 1080p)と長さ(3〜10秒)も指定できます。会話内にある「最新の画像」をもとに生成します。
キャラクター タブ自分で作ったキャラのときだけ表示
プロフィール
名前 / ユースケース / 紹介文 / タグ
キャラの基本情報です。公開したときの一覧やランキングの表示に使われます。
最初のひとこと / 開始シーン / 返信候補
会話の入り口を演出します。開いた瞬間の第一声、始まる場面、最初に出す返信ボタンを設定します。
公開とメディア
公開時の課金
公開したキャラを他のユーザーが使うときの課金方式を選びます(無料 / メッセージ課金 / サブスク限定)。
メディア
表情差分などの画像アップロード、Ditto ソースの登録、画像からの動画生成をまとめて管理します。
長期記憶 タブ会話をまたいで覚えておくメモ
共通 / キャラ別 の長期記憶
会話をまたいで AI が参照するメモです。共通はすべてのキャラで、キャラ別はそのキャラとの会話だけで参照されます。自分の名前・好み・過去の出来事を入れておくと、次に来たときに「覚えている」体験になります。
詳細設定 タブ音声認識(STT)と読み上げ(TTS)の中身
システムプロンプト
AI への指示文です。空欄のときは既定の指示になります。キャラの口調・役割・してはいけないことなどを自由に書けます。
音声認識(STT)
言語
音声認識と読み上げの基準になる言語を選びます(日本語 / English / 中文 / マルチ言語 auto)。マルチ言語では認識時に言語を自動判別し、VoxCPM2 が多言語テキストを合成します。
STT モデル
話した声を文字に起こすエンジンを選びます。Whisper は汎用でサイズを選べ、Qwen3-ASR は高精度(GPU 推奨・初回ロードが重め)、ひらがなは日本語専用の軽量認識です。Whisper サイズ(tiny〜large-v3)は、大きいほど精度が上がり、速度は落ちて VRAM も増えます。GPU なら small〜medium、CPU なら tiny〜base が目安です。
Gemini 生音声入力
ON にすると、文字起こしに加えて生の音声そのものも Gemini に送り、発音や抑揚のニュアンスまで渡します。Gemini 系のモデルを選んでいるときだけ有効です。
読み上げ(TTS)
TTS エンジン
返答を音声に変換する方式を選びます。WebSpeech はブラウザ内蔵で軽量、VoiceVox は日本語のアニメ調、AivisSpeech は感情表現が豊か、VoxCPM2 は多言語・Voice Design・声クローンに対応し、Irodori は文章で声質を指定できます。Irodori は「VoiceDesign キャプション」に日本語で声の雰囲気を書いて制御します。気に入った声を 🎲 で当てて「声色シード」を固定すると、毎回同じ声色に安定します。
読み上げ速度
発話のスピードを調整します(0.5〜2.0 倍)。

会話のイメージ

ペルソナを選んでマイクで話しかけると、AI が音声で返答してくれます。アバターを登録すれば口の動きも同期。

あなた
今日の英語の練習相手になって。仕事で英語面接があるんだ
ペルソナ: Ryan (英会話講師)
Ryan
Sure! Let's start with the classic question. Tell me about yourself — in 30 seconds.
言語: English / 音声: VoxCPM2
あなた
I'm a software engineer with five years of experience...
Ryan
Great opening. Try not to start every sentence with "I" — switch it up. Want me to give you a corrected version?
発音 + 文法フィードバック

対応している音声言語

日本語・英語・中国語を中心に多言語の音声入出力に対応 (VoxCPM2)。ペルソナごとに言語を切り替えられます。

日本語 (JP)English (EN)中文 (ZH)粤語 (YUE)한국어 (KO)Español (ES)Français (FR)Deutsch (DE)Italiano (IT)Português (PT)Русский (RU)

他機能との連携

キャラ音声チャットは Kotonia の他機能と組み合わせると更に強力です。公開ペルソナで対話相手を選び、特定パッケージ商品 (例: メスガキ AI 英会話) とも繋がります。

今すぐ無料でキャラ音声チャットを試す

登録 1 分、クレカ不要。多言語音声会話を無料枠で 1 日 100 往復まで試せます。