[{"@type":"PropertyValue","name":"データ規模","value":"101人、4,538枚"},{"@type":"PropertyValue","name":"収集環境","value":"A4紙"},{"@type":"PropertyValue","name":"収集装置","value":"スキャナー"},{"@type":"PropertyValue","name":"撮影角度","value":"ヘッドアップ"},{"@type":"PropertyValue","name":"データフォーマット","value":"画像データのフォーマットは.jpg、マークアップ文書のフォーマットは.json"},{"@type":"PropertyValue","name":"データ内容","value":"社会民生、娯楽、観光、スポーツイベント、映画、作曲などの分野をカバーします"},{"@type":"PropertyValue","name":"アノテーション","value":"文字レベルの長方形枠のマークアップ、文字レベルの内容転写;行レベルの長方形ボックスのアノテーション、行レベルのコンテンツの転写"},{"@type":"PropertyValue","name":"精度","value":"矩形枠の頂点偏差は3画素以下で正しい検出であり、検出枠の精度は97%以下です。文字転写の精度は97%以上です"}]
{"id":1087,"datatype":"1","titleimg":"https://nexdata.jp/shujutang/static/image/index/datatang_tuxiang_default.webp","type1":"147","type1str":null,"type2":"150","type2str":null,"dataname":"日本語手書き文字OCRデータセット-101人4,538枚","datazy":[{"title":"データ規模","desc":"データサイズ","content":"101人、4,538枚"},{"title":"収集環境","desc":"収集環境","content":"A4紙"},{"title":"収集装置","desc":"収集装置","content":"スキャナー"},{"title":"撮影角度","desc":"撮影角度","content":"ヘッドアップ"},{"title":"データフォーマット","desc":"データフォーマット","content":"画像データのフォーマットは.jpg、マークアップ文書のフォーマットは.json"},{"title":"データ内容","desc":"データ内容","content":"社会民生、娯楽、観光、スポーツイベント、映画、作曲などの分野をカバーします"},{"title":"アノテーション","desc":"マークアップ内容","content":"文字レベルの長方形枠のマークアップ、文字レベルの内容転写;行レベルの長方形ボックスのアノテーション、行レベルのコンテンツの転写"},{"title":"精度","desc":"精度","content":"矩形枠の頂点偏差は3画素以下で正しい検出であり、検出枠の精度は97%以下です。文字転写の精度は97%以上です"}],"datatag":"Japanese,Handwriting,OCR","technologydoc":null,"downurl":null,"datainfo":null,"standard":null,"dataylurl":null,"flag":null,"publishtime":null,"createby":null,"createtime":null,"ext1":null,"samplestoreloc":null,"hosturl":null,"datasize":null,"industryPlan":null,"keyInformation":"","samplePresentation":[{"name":"/data/apps/damp/temp/ziptemp/APY201029001_demo1693389600574/APY201029001_demo/2.jpg","url":"https://bj-oss-datatang-03.oss-cn-beijing.aliyuncs.com/filesInfoUpload/data/apps/damp/temp/ziptemp/APY201029001_demo1693389600574/APY201029001_demo/2.jpg?Expires=4102329599&OSSAccessKeyId=LTAI8NWs2pDolLNH&Signature=Wr%2FmvyKp%2B%2Fw6OVZ7Etgqu1vTjJ0%3D","intro":"","size":0,"progress":100,"type":"jpg"},{"name":"/data/apps/damp/temp/ziptemp/APY201029001_demo1693389600574/APY201029001_demo/3.jpg","url":"https://bj-oss-datatang-03.oss-cn-beijing.aliyuncs.com/filesInfoUpload/data/apps/damp/temp/ziptemp/APY201029001_demo1693389600574/APY201029001_demo/3.jpg?Expires=4102329599&OSSAccessKeyId=LTAI8NWs2pDolLNH&Signature=Vl165NGIjihXPtcQJ15IkguuVX8%3D","intro":"","size":0,"progress":100,"type":"jpg"},{"name":"/data/apps/damp/temp/ziptemp/APY201029001_demo1693389600574/APY201029001_demo/1.jpg","url":"https://bj-oss-datatang-03.oss-cn-beijing.aliyuncs.com/filesInfoUpload/data/apps/damp/temp/ziptemp/APY201029001_demo1693389600574/APY201029001_demo/1.jpg?Expires=4102329599&OSSAccessKeyId=LTAI8NWs2pDolLNH&Signature=%2FiYAJa11zvmV3Qz0AbFvn3aVlPU%3D","intro":"","size":0,"progress":100,"type":"jpg"}],"officialSummary":"日本語手書き文字の自動認識や文書デジタル化の開発では、多様な筆跡・分野を網羅した高精度な教師データの確保が課題です。特に日本市場では、日本語手書き文字認識データセットや、文字レベル・行レベルの両方に対応したOCR教師データへの需要が高まっています。弊社が提供する本データセットは、101名の多様な筆跡から収集された4,538枚の手書き画像です。収録内容は、生活・エンタメ・旅行・スポーツ・映画・作文など、実用的な分野を幅広くカバー。収録環境はA4用紙に手書き。スキャナーで収録。視線レベルのアングルで撮影。データ形式は画像が.jpg、注釈が.json。アノテーションは高精度です。文字レベルの矩形バウンディングボックス+テキスト転写を付与。行レベルの注釈も同時収録。頂点誤差は3ピクセル以内。バウンディングボックス精度・文字転写精度ともに97%超を確保。本データセットは、日本語手書き文字認識モデルの学習や、筆跡理解・文書デジタル化アルゴリズム開発に最適。日本語手書き文字教師データ、手書きノート自動変換、フォーム入力自動化、歴史文書デジタルアーカイブなど、幅広い用途にご利用いただけます。多様な筆跡・分野に対応した高精度な日本語手書き認識を、効率的に実装可能です。さらに、お客様の開発要件に合わせてカスタマイズ対応も可能。収録分野・アノテーション粒度・データ形式などを柔軟に調整。独自性の高い日本語手書きOCRソリューション開発を、最適な学習データ基盤でサポートいたします。","dataexampl":null,"datakeyword":["日本語手書きOCRデータセット","手書き文字認識教師データ","手書きOCRデータセット"],"isDelete":null,"ids":null,"idsList":null,"datasetCode":null,"productStatus":null,"tagTypeEn":"Data Type,Language","tagTypeZh":null,"website":null,"samplePresentationList":null,"datazyList":null,"keyInformationList":null,"dataexamplList":null,"bgimg":null,"datazyScriptList":null,"datakeywordListString":null,"sourceShowPage":"ocr","dataShowType":"[{\"code\":\"0\",\"language\":\"ZH\"},{\"code\":\"1\",\"language\":\"ZH\"},{\"code\":\"2\",\"language\":\"EN,JP,PT,DE,KO,FR,ES\"},{\"code\":\"3\",\"language\":\"EN\"}]","productNameEn":"101 People - 4,538 Images Japanese Handwriting OCR Data","BGimg":"","voiceBg":["/shujutang/static/image/comm/audio_bg.webp","/shujutang/static/image/comm/audio_bg2.webp","/shujutang/static/image/comm/audio_bg3.webp","/shujutang/static/image/comm/audio_bg4.webp","/shujutang/static/image/comm/audio_bg5.webp"],"firstList":[{"name":"/data/apps/damp/temp/ziptemp/APY201029001_demo1693389600574/APY201029001_demo/5.jpg","url":"https://bj-oss-datatang-03.oss-cn-beijing.aliyuncs.com/filesInfoUpload/data/apps/damp/temp/ziptemp/APY201029001_demo1693389600574/APY201029001_demo/5.jpg?Expires=4102329599&OSSAccessKeyId=LTAI8NWs2pDolLNH&Signature=jCFGBgP1FC9%2F4JimiPwL4XVNN4g%3D","intro":"","size":0,"progress":100,"type":"jpg"}]}
https://nexdata.jp/shujutang/static/image/index/datatang_tuxiang_default.webp
[{"@type":"ImageObject","embedUrl":"https://bj-oss-datatang-03.oss-cn-beijing.aliyuncs.com/filesInfoUpload/data/apps/damp/temp/ziptemp/APY201029001_demo1693389600574/APY201029001_demo/2.jpg?Expires=4102329599&OSSAccessKeyId=LTAI8NWs2pDolLNH&Signature=Wr%2FmvyKp%2B%2Fw6OVZ7Etgqu1vTjJ0%3D"},{"@type":"ImageObject","embedUrl":"https://bj-oss-datatang-03.oss-cn-beijing.aliyuncs.com/filesInfoUpload/data/apps/damp/temp/ziptemp/APY201029001_demo1693389600574/APY201029001_demo/3.jpg?Expires=4102329599&OSSAccessKeyId=LTAI8NWs2pDolLNH&Signature=Vl165NGIjihXPtcQJ15IkguuVX8%3D"},{"@type":"ImageObject","embedUrl":"https://bj-oss-datatang-03.oss-cn-beijing.aliyuncs.com/filesInfoUpload/data/apps/damp/temp/ziptemp/APY201029001_demo1693389600574/APY201029001_demo/1.jpg?Expires=4102329599&OSSAccessKeyId=LTAI8NWs2pDolLNH&Signature=%2FiYAJa11zvmV3Qz0AbFvn3aVlPU%3D"},{"@type":"ImageObject","embedUrl":"https://bj-oss-datatang-03.oss-cn-beijing.aliyuncs.com/filesInfoUpload/data/apps/damp/temp/ziptemp/APY201029001_demo1693389600574/APY201029001_demo/5.jpg?Expires=4102329599&OSSAccessKeyId=LTAI8NWs2pDolLNH&Signature=jCFGBgP1FC9%2F4JimiPwL4XVNN4g%3D"}]
日本語手書き文字OCRデータセット-101人4,538枚
日本語手書きOCRデータセット
手書き文字認識教師データ
手書きOCRデータセット
日本語手書き文字の自動認識や文書デジタル化の開発では、多様な筆跡・分野を網羅した高精度な教師データの確保が課題です。特に日本市場では、日本語手書き文字認識データセットや、文字レベル・行レベルの両方に対応したOCR教師データへの需要が高まっています。弊社が提供する本データセットは、101名の多様な筆跡から収集された4,538枚の手書き画像です。収録内容は、生活・エンタメ・旅行・スポーツ・映画・作文など、実用的な分野を幅広くカバー。収録環境はA4用紙に手書き。スキャナーで収録。視線レベルのアングルで撮影。データ形式は画像が.jpg、注釈が.json。アノテーションは高精度です。文字レベルの矩形バウンディングボックス+テキスト転写を付与。行レベルの注釈も同時収録。頂点誤差は3ピクセル以内。バウンディングボックス精度・文字転写精度ともに97%超を確保。本データセットは、日本語手書き文字認識モデルの学習や、筆跡理解・文書デジタル化アルゴリズム開発に最適。日本語手書き文字教師データ、手書きノート自動変換、フォーム入力自動化、歴史文書デジタルアーカイブなど、幅広い用途にご利用いただけます。多様な筆跡・分野に対応した高精度な日本語手書き認識を、効率的に実装可能です。さらに、お客様の開発要件に合わせてカスタマイズ対応も可能。収録分野・アノテーション粒度・データ形式などを柔軟に調整。独自性の高い日本語手書きOCRソリューション開発を、最適な学習データ基盤でサポートいたします。
このデータセットは、商用利用や研究目的などに役立つ有償のデータセットです。著作権ありの既製データセットは、AIプロジェクトの飛躍的なスタートに役立ちます。
![仕様]()
データ仕様
データフォーマット
画像データのフォーマットは.jpg、マークアップ文書のフォーマットは.json
データ内容
社会民生、娯楽、観光、スポーツイベント、映画、作曲などの分野をカバーします
アノテーション
文字レベルの長方形枠のマークアップ、文字レベルの内容転写;行レベルの長方形ボックスのアノテーション、行レベルのコンテンツの転写
精度
矩形枠の頂点偏差は3画素以下で正しい検出であり、検出枠の精度は97%以下です。文字転写の精度は97%以上です
![サンプル]()
サンプル
![おすすめデータセット]()
おすすめデータセット
よくあるご質問

日本語OCRデータは、どのような形式・内容で提供されていますか?

手書き文字、帳票、商品ラベル、看板、公共文書など、実際の業務・生活シーンを想定した多様なデータを提供しています。すべてのデータセットには、行レベル・文字レベルのバウンディングボックスとテキスト転写が含まれ、用途に応じて柔軟にご利用いただけます。各データには詳細な仕様書とサンプルも同梱しており、事前にデータの特徴や適用可能性をご確認いただけます。

英語・日本語など多言語混在の帳票データも収集できますか?

はい、可能です。日本、アメリカ、中国、韓国など主要国を含むグローバルパートナー網を活用し、お客様の指定する業種・地域・フォーマットの実在帳票を現地で収集します。収集と並行して、ネイティブスピーカーによる高精度なアノテーションを即時実施できる体制を整えており、多言語混在文書や業界特化フォーマットにも柔軟に対応します。

多言語や業界特化データにも対応していますか?

はい。日本語(標準語・方言含む)に加え、英語、中国語、韓国語など12言語以上の自然シーンOCRデータを提供しています。製造、物流、小売、金融、公共サービスなど業界別のデータ構成も可能で、お客様のユースケースに最適なデータセットを迅速にご提案・提供いたします。
6e96d6a1-0a20-4e01-a281-b361e313d596