2026.03.25

Qlean Dataset、「日本語・1話者・古典朗読音声データセット」を提供開始

〜GENIAC採択企業のVisual Bank、音声合成および言語モデル領域の高品質な学習データで音声AI技術を支援〜

Visual Bank株式会社(東京都港区、代表取締役CEO 永井真之)は、傘下の株式会社アマナイメージズを通じて展開するAI学習用データソリューション「Qlean Dataset(キュリンデータセット)」において、音声合成(TTS)の精度向上や、文語表現を含む高度な言語理解を目的とした音声・テキストモデルの学習に最適化された、「日本語・1話者・古典朗読音声データセット」の提供を開始します。

本データセットは、日本の古典文学作品を題材とした朗読音声と、その内容を正確に書き起こしたトランスクリプトで構成されています。一人の日本人話者による安定した発話で、古典特有の文法構造や独特な言い回し、リズムを保ったまま読み上げるシーンを網羅しており、特定の声質を再現するモデルの構築や、現代語とは異なる韻律制御を伴う音声生成(AIボイス)の研究開発に適しています。長尺の朗読に含まれる息継ぎや抑揚の変化、文語体における読みの推定など、音響的特徴とテキストの相関を深く学習させることで、文脈を汲み取った自然な発話生成を可能にします。

本データは、Qlean Datasetが展開するAI開発用オリジナルデータラインナップ「AIデータレシピ」の一つとして提供され、オーディオブックの自動生成から、歴史的文献のデジタルアーカイブ化を支援する音声認識(ASR)の実装まで、実用的なAI開発を目指すフェーズでの活用を想定しています。

Visual Bankおよびアマナイメージズは、今後も日本の文化的資産を捉えた音声・言語データの提供を通じて、多様な表現を理解・生成するAIの研究・開発を支援していきます。

今回提供を開始する「日本語・1話者・古典朗読音声データセット」の概要

データ種別

音声、テキスト

被写体属性

日本人

データ形式

音声データ:mp3
テキストデータ:txt,json,txt

収録時間

1音声30秒〜90分

音声レート

44.1kHz / 48kHz

サンプル詳細

https://qleandataset.visual-bank.co.jp/lineup/pn-042

「日本語・1話者・古典朗読音声データセット」のユースケースイメージ

【研究用途】 

  • 文語体における音響的特徴の抽出と韻律解析

    現代語とは異なる文法構造や古い語彙に対し、一貫した話者がどのようにピッチや間(ポーズ)を配置するかを分析し、古典文学特有の韻律モデルを構築する研究に利用できます。

【産業用途】

  • エンターテインメント向け高精度音声合成モデルの開発

    一人の話者による安定した長尺データを学習させることで、オーディオブックやデジタルコンテンツの読み上げに適した、情感豊かで一貫性の高い特定話者音声合成(TTS)エンジンの生成に利用できます。

  • 文語表現を含む自動音声認識(ASR)の精度向上

    日常会話とは語彙体系が異なる古典作品の音声データを用いることで、歴史的資料の翻刻支援ツールや検索システムにおける音声認識モデルの言語適応および認識精度の検証に利用できます。

【その他実需要】 

  • 古典文学の「音読自習」支援アプリの開発

    お手本となる正確な朗読音声とトランスクリプトを照合させることで、生徒の音読が正しく行われているかを判定・評価する、GIGAスクール構想下の教育用AIドリルや学習管理システムの実装に利用できます。

  • 視覚障害者・学習困難者向けのアクセシビリティ向上

    古典特有の難解な漢字や送り仮名、特殊な読み(歴史的仮名遣い)を、一貫した高品質な音声で提供することで、デジタル教科書の音声読み上げ機能や、バリアフリーな古典学習環境の構築に利用できます。

『Qlean Dataset(キュリンデータセット)』について

『Qlean Dataset』は、Visual Bank傘下の株式会社アマナイメージズが提供する商用利用可能なAI学習用データソリューションです。
画像・動画・音声・3D・テキストなど、多様な形式のデータに対応し、研究・商用いずれの用途でも安全に利用できる環境を整備しています。
また、国内・海外のデータホルダーやラジオ・新聞社・通信社等のメディアとの協業を通じ、業界特化・最新トレンドに即したデータラインナップ『AIデータレシピ』を継続的に拡充しています。
Qlean Datasetは、AI開発現場におけるデータ収集・整備の負荷を軽減し、権利クリアで法的リスクのないAI開発環境の構築を支援します。

▶ Qlean Datasetサイト:https://qleandataset.visual-bank.co.jp/
▶ AIデータレシピ:https://qleandataset.visual-bank.co.jp/lineup

Qlean Datasetの特長

  • すべての被写体から同意取得

  • 既存データは最短1日で納品可能

  • カスタム撮影・収録・収集による独自データ構築にも対応

▶ お問い合わせ:https://qleandataset.visual-bank.co.jp/contact

Visual Bank株式会社

AI開発力を最大化する次世代型データインフラを構築・提供するスタートアップ企業として、「あらゆるデータの可能性を解き放つ」をミッションに掲げ事業活動を展開。漫画家の「もっと描きたい!」をサポートするAI補助ツールを提供する『THE PEN』の他、AI学習用データセット開発サービス『Qlean Dataset(キュリンデータセット)』を提供する株式会社アマナイメージズを100%子会社に持つ。
また、Visual Bankは国の研究開発プログラム「GENIAC」にも採択され、社会実装に向けた取り組みを加速させています。

代表取締役CEO:永井 真之
所在地:〒107-0062 東京都港区南青山7-1-7C-Cube南青山ビル6F
Visual Bank企業URL:https://visual-bank.co.jp/
アマナイメージズ企業URL: https://amanaimages.com/about/

  • 音声データセット

  • 日本語音声コーパス

  • トランスクリプト

  • Japanese Corpus

株式会社アマナイメージズ

Visual Bank株式会社


© amanaimages inc.