repocompass.
← 一覧へ

PixelRAG|文書を画像化して視覚情報ごと検索するRAGシステム

PixelRAGは、WebページやPDFをスクリーンショット画像にレンダリングし、画像を直接ベクトル化して検索するPython製のRAGツールです。HTML解析で崩れがちな表やグラフも保てます。

ツール Python ★ 5.4k ライセンス Apache-2.0 記事公開 (注目度9位)

ポイント

  • HTML解析を介さず、表やグラフ、レイアウトを画像として直接RAGに利用可能
  • LoRA微調整済みのQwen3-VL-Embeddingで視覚特徴から直接検索
  • Claude Code対応プラグインを同梱し、コマンド1つでWebを視覚的に要約

概要・解決する課題

従来のテキストベースのRAGでは、HTMLやPDFをプレーンテキストに変換する過程で、複雑な表やグラフ、レイアウト情報が失われ、回答精度が下がる課題がありました。PixelRAGは、ドキュメントをスクリーンショット画像(タイル)にレンダリングし、視覚的な検索インデックスを作成することでこの問題を解決します。ユーザーは、検索クエリ(テキストまたは画像)を用いて、828万ページのWikipediaなどの事前構築インデックスや独自ドキュメントを直接検索できます。

ただし、画像をベースに処理するため、テキスト抽出のみのRAGと比べてストレージやGPU/MPS環境の負荷は大きめになります(公開されている約217GBのインデックスは828万ページのWikipediaを丸ごと索引化したデモ用の一例で、必須容量ではありません。自前のドキュメントだけを対象にすれば桁違いに小さく収まります)。

なぜ注目されているか

LLMのマルチモーダル化(VLM)が進む中、ドキュメントのレイアウトをそのまま理解させるためのアプローチとして「視覚的RAG(Visual RAG)」が実用期に入ったためです。特に、Claude CodeなどのエージェントにWebサイトを文字ではなく「人間の目」のように視覚的に把握させるプラグイン(pixelbrowse)としての実用性が評価されています。

主なユースケース

  • グラフや数表が豊富な技術ドキュメントの検索: PDFやWebページのビジュアル構造を損なわずに検索し、Qwen3-VL-Embeddingモデルを用いて、クエリに合致する特定の画像領域を直接ヒットさせます。
  • Claude CodeによるWebページの視覚的ブラウジング: pixelbrowseプラグインを導入し、エージェントにWebサイトのスクリーンショットを取得させ、人間が見るのと同じレイアウト(図、表、インフォグラフィックスなど)で解釈・要約させます。
  • 自前ドキュメント・サイトの視覚インデックス構築: pixelrag indexが「取り込み→画像化→ベクトル化→FAISSインデックス」を一括で実行し、自分のPDFやWebページから検索インデックスを作成できます(pixelrag serveで検索APIとして公開も可能)。
始め方(クイックスタート)

まず試す(インストール不要): ブラウザのWebデモ(pixelrag.ai)と、828万ページのWikipediaを事前構築したホスト型検索API(api.pixelrag.ai)で、セットアップやAPIキーなしに挙動を確認できます。217GBのインデックスをダウンロードしてローカルに用意する前に、まずここで試せます。

ローカルで使う場合は、以下でCLIとClaude Codeプラグインを導入します。

uv tool install pixelrag
claude plugin marketplace add StarTrail-org/PixelRAG
claude plugin install pixelbrowse@pixelrag-plugins

自分の資料で使うには、pixelshotでWebページやPDFをスクリーンショット画像に変換し、pixelrag indexで埋め込み・索引化します(対象は自分のデータだけなので、容量はWikipedia全体より桁違いに小さく収まります)。Claude Codeで使う場合は、上記のpixelbrowseプラグイン経由でページを視覚的に読ませられます。

claude -p "screenshot https://news.ycombinator.com and summarize the top stories"

独自ドキュメントのインデックス作成など、詳細なパイプライン構築手順は公式リポジトリを参照してください。

こんな人におすすめ

  • 複雑な図表や段組み、PDFのレイアウトを保ったままRAGシステムを構築したいエンジニア
  • Claude CodeなどのAIエージェントに、HTMLパースではなく画像による視覚的Webブラウジングを実行させたい開発者
  • マルチモーダル埋め込みモデル(Qwen3-VL-Embeddingなど)を活用した高度なセマンティック検索を試したい研究者

逆に、整ったテキストが中心の文書なら従来のテキストRAGで十分です。表・図・スキャンPDFなど「見た目に意味がある」資料でこそ効果を発揮します。

関連リソース [PR]

※ Amazon アソシエイト・リンクを含みます。リンク経由の購入で当サイトが収益を得る場合があります。

本記事は GitHub Trending を元に自動生成しています。最新情報は公式リポジトリをご確認ください。