メインコンテンツへスキップ
Nebula・品質評価と検証

AIが文書を正しく理解できる品質を、どのように評価するのか。

Nebulaでは、変換結果が実際のLLMやRAGを活用した業務で役立つかどうかを評価します。日本語・英語の業務文書を対象に、質問へ正しく回答できるか、表の内容から推論できるか、グラフを解釈できるか、文書の階層構造が保たれているかを検証します。

評価の原則

企業が実務で重視する品質を測る。

Nebulaの評価基準は、企業が文書解析AIに求める品質を軸に設計しています。実務で活用できる出力、実際の業務文書への幅広い対応、そして日本語文書における高い処理品質を重視します。

評価用に整えられたデータではなく、実務の文書で

企業が実際に扱うIRリリース、役員会資料、明細、行政帳票などを使って評価します。評価用に選別されたテストデータだけで性能を測ることはありません。

日本語を中核ワークロードとして扱う

日本語のビジネス文書や法務文書は、数ページだけ確認する補足項目ではありません。中核評価セットの一部として扱います。

表面的な文字起こしではなく、使える出力を評価する

文字精度は最低限の基準です。変換後の出力が、LLMやRAGにとって実際に使える形になっているかを評価します。

公開前に代表的な文書で確認する

このページで検証済みと示す機能は、単一の例だけではなく、代表的な顧客向け文書で確認したものです。

評価方法

Nebulaの評価で確認する5つの観点

以下の基準は、実際のお客様が扱う文書を想定した評価用文書に適用します。期待する品質に届かなかった点は記録し、今後の製品開発計画に反映します。

LLMの回答精度

変換後のMarkdownと構造化JSONだけを使い、元のPDFを参照せずに、LLMが実務上の質問に正しく答えられるか

Markdownの使いやすさ

見出し、読取順序、リスト、脚注、文書階層が端から端まで保持されているか。

表・グラフの推論

変換後も、表やグラフ系列が数値・比較の推論を支えられるか。

日本語ビジネス文書

日英混在ページを含め、日本語の法務・財務・IR資料を扱えるか。

企業文書の構造

スライド、レポート、明細、帳票、業務ファイルが、変換後も有用なまま保たれるか。

リーダーボード

本番運用のNebula、ローカルファインチューニング済みのNebula、レビュー済みベースライン。

スコアは、代表的な顧客文書に対してレビューが完了して初めて公開します。ドラフトや仮の数値は掲載しません。詳細レポートが出るまでは、評価対象のシステムと、報告する指標を示します。

Nebula(本番運用)レポート近日公開

フロンティアとファインチューニング済みVLMにまたがる本番ルーティング。

回答精度レポート近日公開
構造の保持レポート近日公開
日本語文書レポート近日公開
Nebula(ローカルファインチューニング済み)レポート近日公開

顧客ドメインの文書でファインチューニングし、プライベートにデプロイ。

回答精度レポート近日公開
構造の保持レポート近日公開
日本語文書レポート近日公開
レビュー済みベースラインレポート近日公開

主要なOCR・ドキュメントAIを、同じルーブリックで評価。

回答精度レポート近日公開
構造の保持レポート近日公開
日本語文書レポート近日公開

詳細な方法論レポートは近日公開予定です。

スコア、データセット、方法論をまとめたレビュー済みレポートを最終調整中です。先行アクセスのご希望や、ご自身の文書を含めたいご要望はありますか。

検証状況

Nebulaで確認できていることと、現在も検証を進めていること。

実際の利用場面を想定した文書で性能を確認できた項目は、「検証済み」と明記します。評価に使った文書がまだ限られている項目についても、その状況を明確に示します。

検証済み · IPCC、METI、財務報告

グラフ

棒・折れ線・円・多パネルの科学図を、構造化されたグラフデータとして返します。

検証済み · BLS A-1、MUFGセグメントデータ

表

多階層のグループ化ヘッダー、階層的な行ラベル、結合セル、数値の忠実性。

検証済み · リンカーン、漱石の原稿

手書き文書

英語の筆記体原稿と、縦書きの日本語自筆原稿を逐語的に書き起こします。

検証済み · IRS Form 1040、国税庁 別表四

帳票

チェックボックス、行番号、扶養家族欄を保持した多セクションの帳票。

検証済み · コーパス拡張中

日本語の財務文書

決算資料、IRリリース、ガバナンス資料を、日本語のビジネス語彙とともに。

検証済み · コーパス拡張中

法務・規制対応PDF

長文の日本語法務テキストでも、脚注・引用・入れ子の見出しを読取順序のまま保持。

FAQ

評価に関するよくある質問。

Nebulaは文書品質をどう評価しますか?

変換後の文書が、実際の下流AI業務を支えられるかで評価します。質問への回答、表の推論、グラフの解釈、文書階層の保持などを確認します。表面的な文字一致は基準であって、目的ではありません。

どの文書タイプを検証済みですか?

グラフ、表、手書き文書、帳票、日本語の財務資料、法務・規制対応PDFが検証済みセットに含まれ、代表的な例はNebula本体ページで示しています。新しいパートナーのオンボーディングに合わせて、顧客を代表するコーパスを継続的に拡張しています。

日本語文書はどう扱いますか?

日本語のビジネス・法務文書は、評価ルーブリックの中核です。日英混在レイアウト、二言語の表、IR資料、長文の規制対応PDFを検証します。日本語は翻訳の後付けではなく、第一級のワークロードです。

評価のために文書を送れますか?

はい。最も早いのは、nebula.ur-ai.net で直接Nebulaを試すことです。サインインして、ご自身の文書を通してみてください。役員会資料、決算資料、規制対応の提出書類、明細、経費ファイル、日本語の企業文書へのフィードバックを特に歓迎します。

お手元の文書で試す

自社の文書でNebulaを評価する。

Nebulaを評価する最も早い方法は、実際の文書で試すことです。サインインして、役員会資料、決算資料、規制対応書類、明細、その他の日本語企業文書をアップロードし、出力をご確認ください。