
KDG INPUT
正しい知識は、正しく読むことから
どんなに優れたAIも、読み取りを間違えれば正しい答えは出せません
日本の産業文書には、意味が図表の中にしか存在しない複雑なレイアウトが数多く存在します。KDG INPUTは、一般的な読み取り方法では正確に扱いにくいこれらの文書を、独自の解析技術で構造ごとデジタル化し、KDGの知識基盤へ正確に取り込みます。
Feature 01
複雑な図表のコンピュータビジョン解析
日本の仕様書・帳票に特有の、結合セル・入れ子表・手書き注記を含む複雑な図表をピクセルレベルで解析します。罫線検出・交点特定・セル構造推定を行い、R1C1形式のセルラベルとガイド画像を生成。LLMに構造情報を正確に伝えることで、表の意味を失わないデジタル化を実現します。
- 1ピクセルレベルの罫線検出で、結合セルや入れ子構造を正確に特定
- 2R1C1ラベル付きガイド画像をLLMに提供し、セル内容を正確に抽出
- 3手書き注記・スタンプ・図面内テキストにも対応した多層解析

Feature 02
ブロック抽出とセマンティックグルーピング
PDFからコンテンツブロックを自動抽出し、意味的に関連するブロックをグループ化します。見出し・本文・表・図を認識し、原本の階層構造(セクション→サブセクション→段落)を保持したまま、構造化されたMarkdownを生成します。各ブロックには原本位置を示すIDが埋め込まれ、いつでも原典に遡れるトレーサビリティを確保します。
- 1見出し・本文・表・図を認識し、原本の階層構造を保持
- 2ブロックIDの埋め込みにより、抽出テキストから原本PDFへの追跡が可能
- 3セマンティックグルーピングで、関連コンテンツを意味単位で自動整理

Feature 03
要件抽出パイプライン
デジタル化した文書から、原文に忠実なアトミックセンテンスと専門用語を抽出し、仕様書品質の要件ステートメントへ変換します。ドメイン分類、正常/異常/不正カテゴリの判定、信頼度スコアの付与まで自動で行い、要件仕様書を自動生成します。
- 1原文に忠実なアトミックセンテンス抽出で、情報の欠落を防止
- 2ドメイン・カテゴリ・信頼度を自動付与し、要件の品質を可視化
- 3表紙・目次・用語集を含む要件仕様書をMarkdownで自動生成

Feature 04
バージョン間差分検出
技術仕様書・規格文書のバージョン間差分を、文字位置レベルの精度で自動検出します。インテリジェントな先読みアルゴリズムでグループ同士を対応付け、LLMによる意味的類似度評価と文字位置の精密比較を組み合わせ、「何が変わったか」だけでなく「なぜ重要か」まで解説するレポートを生成します。
- 1先読みアルゴリズムによるグループ対応付けで、追加・削除にも正確に対応
- 2変更を重大度別(重要変更/追加/削除/軽微な差異)に分類
- 3変更影響の解説付きレポートで、レビュー工数の削減を支援

Feature 05
多段階の精度検証
KDG INPUTは「正しく読む」ことを重視しています。LLM信頼度スコア、文字位置ベースの原典リンク、構造バリデーション、フォールバック機構など、複数の精度検証レイヤーを設けています。抽出されたすべての情報は原典まで遡ることができ、デジタル化の正確性を確かめられます。
- 1LLM信頼度スコア(0.0〜1.0)で抽出精度を定量的に評価
- 2文字位置ベースのリンクで、抽出結果から原典の該当箇所を即座に参照
- 3構造バリデーションとフォールバック機構による二重の品質チェック

