2026.06.29

Qlean Dataset、「日本語・3話者ビジネステーマの対話音声・トランスクリプト」を提供開始

〜投資・保険などのビジネス会話を3話者構成で収録し、人手作成トランスクリプトを付与した商用利用対応コーパス。GENIAC採択企業のVisual Bankが提供〜

Visual Bank株式会社(東京都港区、代表取締役CEO 永井真之)は、傘下の株式会社アマナイメージズを通じて展開するAI学習用データソリューション「Qlean Dataset(キュリンデータセット)」において、「日本語・3話者ビジネステーマの対話音声・トランスクリプト」の提供を開始します。

本データセットは、WEB会議形式で収録された13組の日本語3話者ビジネス対話音声に、人手作成による高品質なトランスクリプトを付与したコーパスです。ASRドメイン適応・LLMのビジネス対話理解向上など、音声系AIモデルの開発・ファインチューニングに活用できます。

■ ビジネステーマ対話音声データセットとは 

ビジネステーマ対話音声データセットとは、投資・保険・商談などの業務文脈で交わされる複数話者の自然な対話を収録した音声コーパスです。ASRモデルのドメイン適応、多話者音声認識・LLMのビジネス対話理解向上を目的とした機械学習データとして活用されます。

■ 今回提供を開始する「日本語・3話者ビジネステーマの対話音声・トランスクリプト」の概要 

本データセットは、性別・年齢の多様性を確保した日本人13組がWEB会議環境で行ったビジネス対話を、3話者構成で収録しています。ビジネス関連トピックを扱う自発的発話のため、専門用語・話者交代・フィラーを含む実務環境に近い音声特性を持ちます。トランスクリプトは自動書き起こしなどを使用せず人手で作成しており、専門用語の誤変換・フィラーの脱落・話者境界のずれを排除でき、WER・CER評価の信頼性と学習データの品質を担保しています。

データ種別

音声(3話者対話形式)

収録話者

性別・年齢の多様性を確保した日本人(13組)

収録時間 / 量

約25時間(63ファイル)/約55GB

データ形式

mp3

サンプリング / ビットレート

48kHz / 192kbps、ステレオ収録

収録内容の特徴

WEB会議想定の3話者ビジネス対話(投資・保険など)、1セッションあたり約90分

利用用途

商用利用可能・研究利用可能・アカデミア無償提供対象

トランスクリプト

人手による書き起こし作業により高品質を担保

サンプルデータはこちらhttps://qleandataset.visual-bank.co.jp/lineup/ds-050

■よくある質問(FAQ) 

Q. 3話者構成は2話者データと何が違いますか?
A. 発話交代パターンが複雑になり、実際のビジネス会議に近い環境を再現できます。2話者ベースのASRモデルの汎化性能検証にも有効です。

Q. 金融・保険分野のASRやLLM開発に使えますか?
A. はい。人手作成トランスクリプトと音声のペアにより、誤認識なしの状態でWhisper LoRAなどのドメイン適応ファインチューニングや、金融特化LLMのSFT・評価データとして直接活用できます。

Q. 議事録生成・会議要約AIの開発に向いていますか?
A. はい。約90分/セッションの長尺収録と人手作成トランスクリプトにより、要約・議事録生成・アクションアイテム抽出タスクのSFTデータとして高精度に利用できます。

Q. カスタム収録に対応していますか?
A. はい。業種・役職・年齢層・対話シナリオを指定したカスタムデータ収集に対応しています。

■ユースケースイメージ 

  • ビジネスドメインASRのファインチューニング
    人手作成トランスクリプトと音声のペアで、WhisperやESPnetのLoRA・full fine-tuningに活用できます。自動書き起こし由来のノイズがなく、WER・CER評価を高い信頼性で実施できます。

  • 多話者ASRの性能評価
    話者交代・重複発話・フィラーを含む3話者音声により、2話者データでは再現できない複雑な発話パターンへのASRモデル対応力を検証できます。

  • LLMによるビジネス対話要約・議事録生成
    人手作成トランスクリプトを用いた要約・議事録生成・アクションアイテム抽出タスクのSFTデータを構築できます。約90分/セッションの長文データにより、長文コンテキスト処理能力の検証・強化にも活用できます。

『Qlean Dataset(キュリンデータセット)』について

『Qlean Dataset』は、Visual Bank傘下の株式会社アマナイメージズが提供する権利クリア・商用利用可能なAI学習用データソリューションです。
音声・画像・動画・3D・テキストなど多様な形式に対応し、基盤モデル開発者をはじめとするAI開発者が、法的リスクなく高品質なデータを調達・活用できる環境を提供しています。
国内外のデータホルダーや、ラジオ・新聞社・通信社等のメディアとの協業により、業界特化・トレンド直結のデータラインナップ『AIデータレシピ』を随時追加中です。既存データは最短2営業日で納品し、その他カスタム収録・収集にも対応しています。
Qlean Datasetサイト:https://qleandataset.visual-bank.co.jp/
AIデータレシピ:https://qleandataset.visual-bank.co.jp/lineup

お問い合わせ

Visual Bank株式会社

AI開発力を最大化する次世代型データインフラを構築・提供するスタートアップ企業として、「あらゆるデータの可能性を解き放つ」をミッションに掲げ事業活動を展開。漫画家の「もっと描きたい!」をサポートするAI補助ツールを提供する『THE PEN』、AI学習用データセット開発サービス『Qlean Dataset(キュリンデータセット)』を提供する株式会社アマナイメージズを100%子会社に持つ。
また、Visual Bankは国の研究開発プログラム「GENIAC」にも採択され、社会実装に向けた取り組みを加速させています。

代表取締役CEO:永井 真之
所在地:〒107-0062 東京都港区南青山7-1-7 C-Cube南青山ビル6F
Visual Bank企業URL:https://visual-bank.co.jp/
アマナイメージズ企業URL:https://amanaimages.com/about/

  • トランスクリプト

  • テキストデータセット

  • 日本語音声コーパス

株式会社アマナイメージズ

Visual Bank株式会社


© amanaimages inc.