よくある質問 / FAQ
基盤モデル・LLMの学習に使える日本語データセットは、どこで調達できますか?
Qlean Datasetが、日本語の音声・動画・画像・テキストデータを権利処理済みで提供しています。テレビ局・ラジオ局・出版社など国内データホルダーが持つ、Web上には出てこない一次データが供給源です。不足するドメインは国内での新規収録・制作で補充します。
学習データの権利処理は、誰がどのように行いますか?
Qlean Datasetが、取得ソースと権利処理を管理した状態で提供します。提供データが適法かつ適正に取得されたものであることを確認しておりお客様(データ利用者)側で個別の権利処理を行う必要はありません。
学習させたモデルの商用利用はできますか?
はい、できます。データは個別契約で定める利用目的の範囲内で利用でき、商用モデルの開発にも対応します。具体的な利用範囲は案件ごとに個別契約で設計します。
データの契約形態・ライセンス条件はどのようなものですか?
「データ提供及びアノテーション業務委託 基本約款」に基づくライセンス提供です(著作権の譲渡・買い切りではありません)。個別契約に特段の定めがない場合、非独占で、再販・サブライセンスは不可です。モデル開発を外部委託するなど第三者がデータを扱う場合は、事前の承諾が必要です。
敬語・方言・世代差など、日本語固有のニュアンスを含むデータはありますか?
はい、あります。日常会話・ビジネス・医療・金融など専門ドメインの音声に加え、方言・感情表現・子ども・高齢者など多様な話者を含む日本語音声コーパスを提供しています。世に存在しないデータは国内で新規収録します。詳細はこちら。
画像・音声・テキストなどをまたいだマルチモーダルの対応付けデータはありますか?
はい、あります。画像・動画・音声・テキストの単体供給に加え、モダリティ間の対応付けを整備して提供します。フィジカルAI向けの実世界データも展開を予定しています。
欲しいデータが世の中に存在しない場合は、どうなりますか?
Qlean Datasetが国内で新規に収録・制作します。音声データであれば、日本語話者の起用、シーン・条件の設計、権利許諾周り、メタデータ整備まで用途に合わせて対応します。発注数量によりますが収録開始から納品まで1ヶ月〜3か月が目安です。
価格はどのように決まりますか?
案件の規模・仕様によって異なります。まずはお問い合わせください。
購入前にサンプルデータの確認はできますか?
はい、NDAの締結不要でデータレシピ(データセット一覧)よりご希望のサンプルデータをご請求いただけます。
海外のデータプロバイダーと比べて、何が違いますか?
日本語・日本文化を映した一次データを、取得ソースが明確な権利クリアの状態で供給できる点は弊社の強みです。
開催予定セミナー
アーカイブ動画
AIデータレシピ
日本語音声コーパス
セミナー
お役立ち情報
お知らせ
採用情報
資料請求
お問い合わせ
│
株式会社アマナイメージズ
会社概要
Visual Bank株式会社
© amanaimages inc.