最近技術系のブログを漁っていると「LLM Wiki」という言葉に行き着いた。関連する技術と合わせて調べていくうちに、これはウィキメディアン・ムーブメントにとっても示唆のある動きなのではないかと思うようになった。この記事では、LLM Wikiとは何か、また関連する技術について紹介したのち、ウィキメディアン・ムーブメントとの関係性について、個人的な考察をまとめてみたい。
LLM Wikiの概要
Diffは技術分野以外に従事しているウィキメディアンの方々にも読んでいただいていると理解している。そういった方々向けに、まずはLLM Wikiや関連する技術について、ざっくりと説明を加えたい。
LLM Wikiとは
LLM Wikiとは、大規模言語モデル(以下、LLM)の回答のベースとなる知識を設計・管理する仕組みのことだ。提唱者は元OpenAIのAndrej Karpathy氏で、2026年4月に自身のXでその概要を述べている。要点を筆者なりに訳すと、次のようになる。
多くの情報源から集められた生データが、LLMによってMarkdownファイルのwikiへとコンパイルされる。LLMは様々なCLIを使ってこのwikiを運用し、質問に答えたり、wikiを段階的に強化したりする。人間がwikiを手動で執筆・編集することはなく、それはあくまでLLMの仕事だ。ここには、単なるハック的なスクリプト群ではなく、優れた新しい製品が生まれる余地がある。(Karpathy, 2026. 筆者による翻訳)

具体的には、LLM Wikiは3つのレイヤーと3つの操作から構成される。(筆者が別の媒体で執筆したブログと類似する説明だが、ご了承いただきたい)
3つのレイヤー
- 生データ:人間が書いた記事や論文など、加工されていない一次情報
- wiki:AIが生データを咀嚼し、AI自身が読みやすいように加工したもの。記事や論文に頻出する概念や価値観などに対応する、ページの集まりだ。ポイントは、AIが生データそのものに毎回立ち返って回答するのではなく、一度wikiとしてコンパイルしておき、それを回答のベースとして使う点にある。生データが追加されれば、wikiも随時更新されていく。
- スキーマ:wikiそのものの構造や、wikiを使った回答生成・メンテナンスに関するメタ的なルールをまとめたもの
3つの操作
- ingest: 人間が新しい情報源(記事、書籍、論文など)を追加する。追加されたソースをAIが読み込み、wikiに要約ページを作成する。
- query: 人間がAIに質問を投げかける。AIはwikiに基づいて回答を作る。Karpathy氏によれば、優れた回答は新しいページとしてwikiに保存することもできるという。(関連:同氏のGitHub Gist)
- lint: AIがwikiを確認し、改訂すべき箇所を指摘する。ページ間の矛盾、古くなった情報、孤立したページ、重要な概念を説明するページや相互参照の欠落、新しい出典が必要な箇所などをチェックする。
他の技術・用語との関連
- RAG (Retrieval-Augmented Genration) / Graph RAG: 同じくLLMの知識管理に用いられる技術。RAGは生の文書をベクトル化して検索する。Graph RAGは、エンティティやエンティティ同士の関係性もモデリングできる点が特徴だ。
- OKF(Open Knowledge Format): LLM Wikiを、どんなシステムにも移植可能な形式に落とし込んだもの。2026年6月、Google Cloudのブログで発表された。基本構造は、Markdownで書かれた本文と、YAMLで記述されたフロントマター(タイプやタイトル、タグなどのメタデータ)のみというシンプルなものだ。特定のベンダーやシステムに依存せず、どのサービスが提供するAIエージェントでも共通の仕組みを使うことができる。また、Markdownファイルであるため、人間にとっても読みやすい。
ウィキメディアン・プロジェクトとの関連
ここからは私見に基づく、個人的な考察や連想、疑問が多くなる。
OKFとWikidata・Wikipediaの関係
OKFはフロントマターとMarkdown本文から成るが、これはメタデータの集まりであるWikidataと、特定の概念に関する説明を自然言語でまとめたWikipediaを統合したような形をしている。もっとも、単純に両者を合体させただけのものでもない。Wikidataには多くのプロパティが含まれているが、Google Cloudのブログ本文に登場するメタデータは比較的少ない。雑な例えをすれば、OKFはWikidataのプロパティの多くを削ぎ落として、必要最低限にしたもの、とも言えそうだ。
実際にこの2つを統合して1つのファイルとして扱うとしたら、何がどう変わるのだろうか。Wikipediaは国内外で多くの自然言語処理モデルの学習データとして利用されてきたが、それはあくまで大量の文章を読ませるためであって、LLM Wikiのように、モデルが改めて自分で文章を咀嚼し、概念を作り直しているわけではない。Wikidata embedding projectのような取り組みもあるが、OKFはそれに加えて、Wikipediaに書かれるような自然言語の説明までも取り込もうとしている。
そう考えると、WikipediaとWikidataを合わせて、「人間もAIも」わかり、かつ活用できる知識基盤ができたとしたら、それは人間とAIにどんな変化をもたらすのだろうか。
多言語対応について
LLM Wikiは多言語対応にも活用されているようだ。実際に、自身の記事について、人間が作ったメモをベースにLLMがwikiを作り、その内容をもとに日本語版・英語版の両方の記事を書かせた、という事例がある(こちらのブログなどを参照)。興味深いのは、この2つの記事が全く同じ内容を別言語で記述したものではなく、同じ概念をそれぞれの文化的文脈に合わせて書き直していたという点だ。これは現実世界で、言語を超えて存在する概念を、それぞれの言語・文化に属する人間がどう理解し、同じ言語・文化を持つ人と共有しているかという実態に近いように思う。また、wikiが多言語対応の核になっているという点では、複数の言語版のハブとして機能しているWikidataにも似ている(人間が自分の手で作ったのか、AIが自分用に作ったのかという違いはやはり残るが)。
私自身がWikipediaに関わり始めた頃、まず着手したのは既存記事の翻訳だった。海外のWikipediaを読んでいると、日本語版にはない概念や説明、情報源が書かれていて、それが刺激的だったからだ。だから他の言語版からもたくさん学びたいし、それを多くの人に共有できたらいいなと思っている。しかし、少なくともAIのような機械にとっては、異なる文化に属する人間が同じ概念について最低限持っておくべき知識というのは、実はそれほど多くないのかもしれない。
とはいえそれは、今の文化に合わせた情報のキュレーションでもある。私たちは、自分たちが知っているものとは異なる文化・社会について知ることで、自分自身の理解を変えてきた側面もある。今の文化に基づいた情報の過度な簡略化は、「他の文化からの学び合い」や、そこから何か新しいものを生み出すことから、かえって遠ざかってしまうのではないだろうか。
AIが作る概念ノートと、人が書くWikipediaの記事
LLM Wikiを取り入れた場合、LLMは生データに基づいて自分用のwikiを作る。もちろんLLM Wikiは社内ナレッジの共有などにも使われるものであり、その場合wikiとして保存されるのは、個別の組織や団体に最適化された概念になるはずだ。
しかし、例えばLLMに論文を読ませて、そこに出てくる概念をLLM Wikiとして管理させたとしたら、そうした過程を経て抽出された概念ノートは、複数の情報源に基づいて執筆されたWikipediaの記事と、見た目上はかなり似通ってくるのではないだろうか。
その際、AIが新しい概念を抽出してwikiとして要約する場合と、実際に人が新規ページを作る場合とで、動機や生成される概念の説明にどんな違いが出るのだろう。人には例えば「重要な概念なのに記事がない」「興味のある分野についてまとめたい」といった動機があるはずだ。一方でLLMは、自分が参照しやすい形にコンパイルした結果としてwikiを作る。AIによって最適化された概念の説明と、人間による概念の説明とでは、どんな差が出てくるのだろうか。もし後者に残るものこそが「人間らしさ」なのだとしたら、それはどんなふうに定義できるのだろう。
Wikipediaという「生データ」
私はこれまで、WikipediaをAI時代の重要な情報源として注視してきた。しかし、LLM Wikiの枠組みにとっては、Wikipediaももはや、人間が書いた生データの一種になったのだろうと思う。Wikidataもまた、コンピュータによる処理のしやすさを強みとして持ってきたが、その強みは今後も生き続けるのだろうか。人間が用意したプロパティと、AIが自分にとって読みやすいように自ら用意したプロパティ―AIはどちらを信用し、回答のベースとして使うか、それも気になっている。
結び
個人的には、次世代の知識管理の方法として「Wiki」という形式が選ばれたことが、とても興味深いと感じている。ある概念に関するデータが、自身の説明を含むのみならず、他の概念とリンクでつながって、その概念の文化・社会的な文脈に対する理解を深めてくれる―WikipediaやWikidataにも貫かれるこの設計は、私の興味を惹くものであるうえに、それがLLMにとっても役に立ってくれる(可能性がある)という点で関心を持っている。
一方で、そのプロトタイプ的な側面も含んでいるWikipediaやWikidataが、今後どのようなデータベースへと変化し、どのように活用されていくのか。引き続き注目していきたい。
Can you help us translate this article?
In order for this article to reach as many people as possible we would like your help. Can you translate this article to get the message out?
Start translation