「Datatang株式会社」は現在「Nexdata」のブランドとして事業を展開しています。本サイトより最新のAIデータサービスとソリューションをご案内いたします。

jp

Please fill in your name

Mobile phone format error

Please enter the telephone

Please enter your company name

Please enter your company email

Please enter the data requirement

Successful submission! Thank you for your support.

Format error, Please fill in again

Confirm

The data requirement cannot be less than 5 words and cannot be pure numbers

世界のAI大手企業、ベンチャー企業・スタートアップ、大学研究機関から信頼されます。

  • NVIDIA
  • Microsoft
  • Intel
  • APTIV
  • Qualcomm
  • SAMSUNG
  • BOSCH
  • General Motors
  • Tencent
  • AWS
  • Google
  • Cerence
  • Deepmotion
  • Meta

人気のデータセット

すぐに使える最新のデータセットにアクセスし、ビジネスの成長を促進しましょう。

151万セット画像編集インストラクションデータセット

現在、生成AIや画像編集モデルの開発では、多様な編集指示に高精度で応答できるインストラクションベース画像編集データの確保が課題です。特に日本語対応の生成AI教師データセットや、ピクセルレベル編集注釈付きの画像合成学習データへの需要が急増しています。弊社が提供する本データセットは、151万セットの高品質な画像編集ペアを収録。対象ターゲットは人物(クローズアップ・半身・全身)をはじめ、動物・商品・植物・建物・風景・旅行写真・家庭シーンなど、実用的な画像カテゴリを幅広くカバーします。編集タイプは5種類。人物・物体の一貫性編集50万セット、構造的編集30万セット、複合編集21万セット、空間編集45万セット、スタイル転送編集5万セット。多様な編集ニーズに対応可能です。収録条件は高品質です。画像解像度は2K以上を保証。データ形式は画像が.jpg/.jpeg/.png、編集指示テキストが.txt。アノテーションは編集指示に従ったピクセルレベル編集を実施。精度保証も万全です。編集済みデータの適合率は97%超。編集対象と元対象のエッジ誤差は5ピクセル以内を維持。生成モデルの学習用として最適な品質を実現。本データセットは、画像合成モデルの学習や、データ拡張・仮想シーン生成アルゴリズム開発に最適。生成AI教師データセット、インストラクションベース画像編集学習、テキスト指示対応画像生成、マルチモーダルAI開発など、幅広い用途にご利用いただけます。多様な編集指示に高精度で応答する画像生成モデルを、効率的に実装可能です。さらに、お客様の開発要件に合わせてカスタマイズ対応も可能。収録ターゲット種別・編集タイプ・アノテーション粒度・データ形式などを柔軟に調整。独自性の高い生成AIソリューション開発を、最適な学習データ基盤でサポートいたします。

生成AI教師データ画像編集 画像編集インストラクションデータセット 画像合成 学習データ 生成モデル

300時間日本語金融自然対話音声データセット

弊社では、会議シーン・金融窓口・カスタマーサポートなど、あらゆる実環境の音声データに加え、感情認識・動作認識・マルチモーダルデータまで幅広く対応いたします。すべて商用利用可能で、モデル学習の初期段階からそのままご活用いただけます。本データセットは、実世界の金融シーンの多様性を反映した日本語音声データです。窓口対応・電話相談・オンライン対話などの実際のインタラクションを口語化コーパスで収録。金融特有の専門用語や複雑な文脈を自然に含み、ASR・NLPモデルのロバスト性と汎化性能を大幅に向上させます。アノテーションは98%超の高精度を保証。転写テキストに加え、タイムスタンプ・話者分離・環境ノイズ・機密情報ラベルまで詳細に付与。モデルの学習効率と認識精度の最大化に貢献します。収録条件は低ノイズ環境。16kHz/16bitのWAVフォーマットで提供するため、前処理負荷を最小限に抑え、ディープラーニングの本質的な特徴抽出を可能にします。さらにGDPR・CCPAなどの厳格なデータ保護規制に完全準拠。企業規模のAI開発にも安心してご導入いただけます。さらに、音声データ収集に特化した専門チームとプロジェクト管理チームが在籍。金融分野をはじめ、業界固有の用語・シナリオ・言語に対応したカスタム収集・アノテーションプロジェクトを柔軟に請け負います。納品データは前処理不要で、すぐにモデル訓練へ投入可能。AI開発の効率化と商用化を、ワンストップでサポートいたします。

音声認識データセット 日本語音声認識データ 金融分野音声データセット 金融音声データ 金融チャットボット音声データ ドメイン特化日本語音声コーパス

48kHz・579時間高音質・話者分離日本語自然会話音声データセット

本データは、フルデュプレックス(全二重)対話を前提に収録した高品質な日本語音声データセットです。半二重方式では再現が難しい同時発話や重なり発話、自然な相槌や割込みを含み、双方向に同時進行する対話を再現した同時双方向音声データセットとして、リアルタイム対話AIや次世代ASRの研究開発に適しています。本セットは、提示されたトピックリストから収録者が複数の得意分野を選択し、自然な流れで会話を展開して収録した日本語自然会話音声データセットです。日本各地のネイティブ話者による多様な対話を含み、高音質収録によりASRの音響・言語モデル学習、声紋識別、対話システム評価など幅広い研究用途に活用できます。データは各種プライバシー保護規制に準拠して管理されています。当社の全二重音声データセットシリーズは、日本語をはじめ、英語、韓国語など多言語に対応し、書き起こしテキスト、発話タイムスタンプ、話者ID、性別などの詳細アノテーションを標準搭載しています。また、話者ごとの独立音声を含む話者分離音声データセットとしても利用可能で、収録条件や話者属性、ラベル仕様のカスタマイズ収集・作成にも柔軟に対応します。

日本語音声データ 話者分離音声データ 全二重音声データセット 同時双方向音声データセット 日本語自然会話音声データ

205時間話者分離日本語自然会話音声データセット

本データは、フルデュプレックス(全二重)対話を前提に収録した高品質な日本語音声データセットです。有効時間205時間。半二重方式では再現が難しい同時発話や重なり発話、自然な相槌や割込みを含み、双方向に同時進行する対話を再現した同時双方向音声データセットとして、リアルタイム対話AIや次世代ASRの研究開発に適しています。そして、本セットは提示されたトピックリストから収録者が複数の得意分野を選択し、自然な流れで会話を展開して収録した日本語自然会話音声データセットです。日本各地のネイティブ話者による多様な対話を含み、高音質収録によりASRの音響・言語モデル学習、声紋識別、対話システム評価など幅広い研究用途に活用できます。データは各種プライバシー保護規制に準拠して管理されています。 当社の全二重音声データセットシリーズは、日本語をはじめ、英語、韓国語など多言語に対応し、書き起こしテキスト、発話タイムスタンプ、話者ID、性別などの詳細アノテーションを標準搭載しています。また、話者ごとの独立音声を含む話者分離音声データセットとしても利用可能で、収録条件や話者属性、ラベル仕様のカスタマイズ収集・作成にも柔軟に対応します。

日本語音声データ 話者分離音声データ 全二重音声データセット 同時双方向音声データセット 日本語自然会話音声データ

200時間韓国語話者分離・自然会話音声データセット

本データは、フルデュプレックス(全二重)対話を前提に収録した高品質な韓国語音声データセットです。半二重方式では再現が難しい同時発話や重なり発話、自然な相槌や割込みを含み、双方向に同時進行する対話を再現した同時双方向音声データセットとして、リアルタイム対話AIや次世代ASRの研究開発に適しています。本セットは、提示されたトピックリストから収録者が複数の得意分野を選択し、自然な流れで会話を展開して収録した韓国語自然会話音声データセットです。約200名の韓国ネイティブスピーカーによる多様な対話を含み、高音質収録によりASRの音響・言語モデル学習、声紋識別、対話システム評価など幅広い研究用途に活用できます。データは各種プライバシー保護規制に準拠して管理されています。当社の全二重音声データセットシリーズは、日本語をはじめ、英語、韓国語など多言語に対応し、書き起こしテキスト、発話タイムスタンプ、話者ID、性別などの詳細アノテーションを標準搭載しています。また、話者ごとの独立音声を含む話者分離音声データセットとしても利用可能で、収録条件や話者属性、ラベル仕様のカスタマイズ収集・作成にも柔軟に対応します。

韓国語音声データセット 韓国語自然会話音声データ 韓国語話者分離音声データ 韓国語音声認識データ

5,147件日本語手書きOCRデータセット

日本語手書き文字の自動認識や文書デジタル化の開発では、日本人の自然な筆跡を反映した高精度な教師データの確保が課題です。弊社が提供する本データセットは、日本人548名から収集された5,147枚の手書き画像です。性別は男性244名・女性304名。年齢層は18〜45歳が中心(494名)。実用的な筆跡バリエーションを網羅します。収録環境はA4用紙・罫線入り用紙・方眼用紙など。スマートフォンで撮影。視線レベルのアングルで統一。データ形式は画像が.jpg、注釈が.json。収録コンテンツは多岐にわたります。作文・詩・散文・ニュース・物語など、実用的な日本語テキストを幅広くカバー。日常の手書き表現を自然に反映しています。アノテーションは高精度です。行レベルの四角形バウンディングボックス+テキスト転写を付与。収集精度・文字転写精度ともに97%超を確保。学習用として最適な品質を実現。本データセットは、日本語手書き文字認識モデルの学習や、筆跡理解・文書デジタル化アルゴリズム開発に最適。日本人筆跡特化の日本語OCR教師データ、手書きノート自動変換、フォーム入力自動化、教育・出版分野のデジタルアーカイブなど、幅広い用途にご利用いただけます。さらに、お客様の開発要件に合わせてカスタマイズ対応も可能。収録コンテンツ・アノテーション粒度・データ形式などを柔軟に調整。独自性の高い日本語手書きOCRソリューション開発を、最適な学習データ基盤でサポートいたします。

日本語手書きOCRデータセット 日本語手書き文字教師データ OCRデータセット 日本語OCR教師データ
テキストデータサービス 動画データサービス 画像データサービス 音声データサービス

データサービス

Nexdataはグローバルなデータ処理工場とプロのアノテーターを20,000人以上整備しており、音声、画像、ビデオ、点群、テキストなどのオンデマンドデータアノテーションサービスをサポートしています。

プラットフォーム

独自のヒューマン・マシン・インタラクティブ半自動アノテーションプラットフォームは、より競争力のあるAI製品を構築するお手伝いをします。

3D点群アノテーションツール

3D 点群アノテーションツール

音声アノテーションツール

音声アノテーションツール

リモートセンシングアノテーションツール

リモートセンシング向けたツール

動画アノテーションツール

動画アノテーションツール

2D画像アノテーションツール

2D画像アノテーションツール

テキストアノテーションツール

テキストアノテーションツール

Nexdata アノテーションプラットフォーム Nexdata アノテーションプラットフォーム

生成AIデータサービス

当社のデータサービスは、生成AI開発の各段階におけるお客様のAIイニシアチブの成長を加速。

ファインチューニング

ヒントとアウトプットのアノテーションにより、モデル最適化のための高品質な教師ありファインチューニングデータを作成します。

人間のフィードバックによる強化学習

SFTで学習されたモデルによって生成された複数のアウトプットを、お客様が提供したルールに従って手動でランク付けしたり、多要素スコアリングをします。

レッドチーミング

悪意のある質問や有害な可能性のある質問など敵対的な攻撃を想定し、モデルの訓練と検証を行います。

ファインチューニング
自動運転向けデータサービス

Nexdataは車内センシングから車外知覚までカバーするデータを提供し、自動運転ソリューションのあらゆるニーズにお応えします。

車室内感知データセット

車室内データセット

Nexdataは1000を超える既製データセットを保有しており、すぐに納品可能です。また、頭のポーズ、視線、表情認識、ジェスチャー検出など、車内アプリケーションのためのデータカスタマイズサービスも提供しています。

LiDARデータアノテーション

3D点群データアノテーション、データ収集、プライベート導入可能なアノテーションプラットフォームなどADAS/AV向けにカスタマイズデータソリューションを提供します。

Nexdataが選ばれる理由
高品質

高品質

マルチレベル品質検査、ISO9001品質管理認証により、高品質のデータを納品します。

高効率

高効率

ヒューマンマシンインタラクションと半自動アノテーションをサポートし、一人あたりアノテーション効率を30%以上向上させます。

コンプライアンス

コンプライアンス

当社はGDPRおよびCCPAの規制に準拠しており、当社と共有されるすべてのデータを保護します。

セキュリティ

セキュリティ

データ収集、カスタマイズサービス、データプラットフォームをカバーする包括的なセキュリティ・パイプラインにより、データ・セキュリティを徹底します。

よくあるご質問

既製品データセットは無料サンプル入手可能ですか?

お客様のご要望に応じて、既製品データセットを提案しています。もちろん、データの詳細、サンプルなどご提供可能です。

既製データセットの安全対策はどうなっていますか?

全てのデータセットは弊社版権で取り扱っています。データの提供元からAIモデル・機械学習開発に使われる許可を得ています。お客様には安心してお使いいただけます。

日本語の方言音声データ収集は対応できますか?

はい。関西弁、九州弁、東北弁など、地域ごとのアクセントに対応した収集が可能です。

学術研究向けの無料データセットは提供していますか?

はい、提供しています。Nexdataでは、大学や研究機関など世界中の非営利組織を対象に、「AIデータ支援研究プログラム」を実施しています。このプログラムを通じて、コンピュータビジョンや音声認識など、さまざまな分野における高品質なトレーニングデータセットを無償で提供し、AI研究の発展をサポートしています。ご要望に応じて、既存の提供範囲外のデータセットについても、個別にご相談承ります。

最新情報

0890c8fc-5992-4eb1-b4b5-1cae8e2d69cb