RCRRベンチマーク公開:文書変換で「意味」はどれだけ生き残るか
商用OCR製品、オープンウェイトモデル、フロンティアVLM APIの14システムを、ただ一つの基準で測定した。日本語IR資料のページをMarkdownに変換したあと、人間が元のページから答えられる質問に、AIも答えられるか。スコアは20.2から94.6まで開き、市場を分けるのはチャートだった。
読了目安 8分
これからの2〜3年で勝ち残る企業は、AIワークロードの約80%を、自社専用に調整しローカル環境で運用するLLMで動かすようになる。私たちはそう考えています。
残りのワークロードでは、必要に応じてフロンティアモデルの力を安全に使う設計が求められます。Ur AIは、その両方を支えるフルスタックを構築しています。信頼でき、自社で管理でき、評価でき、自社データに合わせて調整できるAIのために。
各レイヤーを、ブラックボックスとして借りるのではなく、自社で管理し、監査し、自社の業務に合わせて調整できるよう設計しています。
グラフ、表、契約書、開示書類など、複雑なファイルの中に埋もれている業務知識。
それを、レイアウトを保持したMarkdownと構造化JSONへ変換し、AIが実際に答えを導ける形にします。スタック全体を支える基盤エンジンです。
多くのワークロードは自社専用のローカルLLMで処理し、必要なタスクだけフロンティアモデルへ安全にルーティングします。
answerability(答えられるか)を測定し、モデルを既存システムへ組み込み、ワークフローが変わっても品質を監査可能に保ちます。
重要度の高い業務をこのスタック上で動かします。最初の実証領域が、デューデリジェンス向けのSpecterです。
Nebulaが基盤です。Specterは、それを重要度の高い領域で実証する最初のワークフローアプリケーションです。
NebulaのドキュメントインテリジェンスをREST APIで自社のパイプラインに組み込めます。
SpecterはNebula上で動作します。同じ基盤を、M&Aデューデリジェンスに適用しています。
"Ur AIは、AIを前提とした業務基盤を実装し、人と組織がより重要な判断に集中できる状態をつくることを目指す。企業がAI時代に持続的な競争力を持てるよう後押しする。"
AI、M&A、エンタープライズソフトウェアの実務を横断する国際チームである。研究・プロダクト・エンジニアリング・オペレーションの各領域に強みを持ち、現場の制約と、それを支える技術の両方を理解した上でプロダクトを磨いている。
メンバーをクリックすると経歴を確認いただけます
Ur AIのプロダクトは、情報セキュリティとデータ保護が求められる現場を前提に設計している。
情報セキュリティマネジメント
認証取得済みサービス提供における統制基準
対応中一般データ保護規則
対応中イノベーションとAIへの信念が、私たちの出発点でした。
"「0-1のブレークスルーが生まれても、それだけでは産業は変わらない。社会に届く形まで実装され、運用されて、はじめて価値になる。発明とスケールがつながるとき、変化は一気に現実になる。」
Transformers、GPT、Gemini、Claude Code。現代AIの基盤技術は西洋で生まれてきた。ただし、産業で価値になるかは別の話である。実務に耐える形まで落とし込み、組織の運用にのせる段階では、アジアが担う役割は大きい。
Ur AIは、AIの次の実装局面を日本から進めるという考えから生まれた。IIT Delhi、IIT Bombay、IESE、McKinsey、Fujitsu、Woven by Toyota、Laboro AIなどで経験を積んだ多国籍のチームが知見を持ち寄っている。
私たちはAIを、人の判断を置き換えるものではなく、判断の質と速度を引き上げる基盤技術だと捉えている。Specterは、その思想をDDの現場で形にした最初のプロダクトである。
商用OCR製品、オープンウェイトモデル、フロンティアVLM APIの14システムを、ただ一つの基準で測定した。日本語IR資料のページをMarkdownに変換したあと、人間が元のページから答えられる質問に、AIも答えられるか。スコアは20.2から94.6まで開き、市場を分けるのはチャートだった。
読了目安 8分
RCRR技術レポートの全文。主要比較14システム、実在の日本語IR資料99ページ、検証済み1,410問をエンドツーエンドで測定。手法、実例、統計、ゴールドの出典、限界まで、結果に挑戦するために必要なすべてを公開する。
読了目安 18分
最先端のLLMが日本語ドキュメントでつまずくのは、日本語が3種類の文字体系を混在させ、単語間にスペースを置かず、しばしば縦書きで書かれるためです。縦書きでは誤り率が約10倍に跳ね上がります。本記事では、日本語ドキュメントの何が特殊なのか、モデルがどこで破綻するのか、そして実際に機能するものは何かを解説します。
読了目安 6分