2025.12.12

Qlean Dataset、「日本語・3話者・コメディテーマトーク音声コーパスデータセット」を提供開始

〜GENIAC採択企業のVisual Bank、多人数音声処理・対話AI開発を支える3話者自然対話データを提供〜

Visual Bank株式会社(東京都港区、代表取締役CEO 永井真之、以下「Visual Bank」)は、傘下の株式会社アマナイメージズを通じて展開するAI学習用データソリューション『Qlean Dataset(キュリンデータセット)』において、『日本語・3話者・コメディテーマトーク音声コーパスデータセット』の提供を開始しました。

本データセットは、Qlean Datasetが展開する機械学習用データセットラインナップ「AIデータレシピ」の新たな1ラインナップとして拡充されたもので、3名の話者によるコメディ調の自然な掛け合いを収録しています。そのため、音声認識(ASR)、会話理解、対話生成、話者追跡など、多人数対話を対象とするAI領域の研究・開発に活用できます。

さらに、本データセットでは、重なり発話や割り込み、テンポのある応答、話題転換など、3話者構成ならではの自然な対話特性を多様に記録しています。こうした多人数会話特有の構造は、話者分離モデルや自然対話理解モデル、対話生成モデルなど、多人数環境を前提とするAI開発に必要な学習・検証データとして有効です。
また、自然な複数話者環境を前提として収録されているため、実利用環境に近い条件でのモデル精度検証や汎化性能向上に寄与します。特に、対話型AI、議事録生成AI、音声エージェント、ロボティクス対話などにおいて、話者推定やターンテイキング、話題遷移処理といった開発ニーズへの対応が可能で、教育・研究用途を含む幅広いAI開発環境でも活用できます。

今回提供を開始する「日本語・3話者・コメディテーマトーク音声コーパスデータセット」の概要

データ種別

音声

被写体属性

20代〜50代の男女

データ形式

mp3 / wav

収録時間

計約100時間(1音声約20分〜30分)

音声レート

44.1kHz

対象のシーン

・3名によるコメディ調の雑談や掛け合い、エピソードトークのシーン
・テンポのある応答や即興的な発言、自然な間合いを含む対話シーン
・話題が自然に遷移し、重なり発話や割り込みが発生する多人数会話シーン
・台本に依存しない、自発的な話題展開や感情変化がみられる自然対話シーン

話題例

恋愛相談、思い出話(初恋、笑える失敗談など)、マイブーム、趣味、流行、好きなお菓子について、など全約200話題

サンプル詳細

https://qleandataset.visual-bank.co.jp/lineup/pn-035

「日本語・3話者・コメディテーマトーク音声コーパスデータセット」のユースケースイメージ 

【研究用途】

  • 多人数会話における話者分離・話者推定研究 

    3話者が同時に発話・割り込み・重なりを行う自然な音声データにより、多人数環境での話者識別・話者特徴抽出・話者 diarization モデルの性能検証が可能です。

  • 自然対話理解・会話行動分析研究 

    コメディ的なテンポ・即興性・話題転換を含むため、ターンテイキング、会話構造解析、話題遷移モデルの研究素材として活用できます。

  • 自然言語処理 × 音声処理のマルチモーダル対話研究 

    多人数トークの音声特徴を用い、対話生成モデル・発話予測モデル・応答最適化モデルの学習データとして使用できます。

 【産業用途】

  • 多人数会話対応の音声認識(ASR)エンジン開発 

    重なり発話や割り込みを含む3話者データにより、会議AI、音声議事録生成AI、カスタマーセンター向け対話AIなど、実環境を想定したASR精度向上に活用できます。

  • 対話型AI(音声エージェント・アシスタント)の自然対話生成 

    テンポのある掛け合いデータにより、対話生成モデルの自然さ・応答多様性・リアクション生成の精度改善に寄与します。

  • マルチスピーカー音声処理技術の検証 

    音声分離、話者追跡、音量・位置推定など、複数話者状況を前提とした音声処理アルゴリズムの開発に活用できます。

 【その他実需要】

  • 教育機関での音声処理・対話AI教材 

    多人数会話の音声データとして、音声工学・自然言語処理の教材、演習データとして利用可能です。

『Qlean Dataset(キュリンデータセット)』について

『Qlean Dataset』は、Visual Bank傘下の株式会社アマナイメージズが提供する商用利用可能なAI学習用データソリューションです。
画像・動画・音声・3D・テキストなど、多様な形式のデータに対応し、研究・商用いずれの用途でも安全に利用できる環境を整備しています。
また、株式会社千葉ロッテマリーンズや株式会社東洋経済新報社をはじめとするデータパートナーとの協業を通じ、業界特化・最新トレンドに即したデータラインナップ『AIデータレシピ』を継続的に拡充しています。
Qlean Datasetは、AI開発現場におけるデータ収集・整備の負荷を軽減し、権利クリアで法的リスクのないAI開発環境の構築を支援します。

▶ Qlean Datasetサイト:https://qleandataset.visual-bank.co.jp/
▶ AIデータレシピ:https://qleandataset.visual-bank.co.jp/lineup

Qlean Datasetの特長

  • すべての被写体から同意取得

  • 既存データは最短1日で納品可能

  • カスタム撮影・収録・収集による独自データ構築にも対応

▶ お問い合わせ:https://qleandataset.visual-bank.co.jp/contact

Visual Bank株式会社

AI開発力を最大化する次世代型データインフラを構築・提供するスタートアップ企業として、「あらゆるデータの可能性を解き放つ」をミッションに掲げ事業活動を展開。漫画家の「もっと描きたい!」をサポートするAI補助ツールを提供する『THE PEN』の他、AI学習用データセット開発サービス『Qlean Dataset(キュリンデータセット)』を提供する株式会社アマナイメージズを100%子会社に持つ。
また、Visual Bankは国の研究開発プログラム「GENIAC」にも採択され、社会実装に向けた取り組みを加速させています。

代表取締役CEO:永井 真之
所在地:〒107-0062 東京都港区南青山7-1-7C-Cube南青山ビル6F
Visual Bank企業URL:https://visual-bank.co.jp/
アマナイメージズ企業URL: https://amanaimages.com/about/

  • 音声データセット

  • 日本語音声コーパス

株式会社アマナイメージズ

Visual Bank株式会社


© amanaimages inc.