LLMやRAGで成果を出すための文書構造を理解する

アシム(Media Fusion / エンジニア)
こんにちは!ネパール出身のアシム・レグミと申します。
Media Fusion Co., Ltd.でJava Backendエンジニアとして勤務しています。
データ基盤やAI時代のデータ活用に関心を持ち、データ技術に関する実務で得た知見や経験をご紹介していきたいと考えています。

「AIデータ基盤 2026」シリーズ
▼第1回:なぜMarkdownがAI活用の基盤となるのか?(本記事)
― LLMやRAGで成果を出すための文書構造を理解する ―▼第2回:YAMLを活用してAIワークフローを効率的に管理する方法
― AIエージェント時代に求められる設定管理とは ―▼第3回:Open Knowledge FormatでAI時代の知識基盤を構築する
― 再利用しやすいデータ管理の考え方と実践方法 ―
はじめに
ChatGPTやClaudeなどの生成AIを業務で使う企業が増えています。しかし、次のような壁にぶつかっている担当者も少なくありません。
- AIが期待した回答を返さない
- 社内文書を検索しても、正しい情報にたどり着けない
- RAGやAIエージェントを導入しても、思ったほど効果が出ない
原因の多くは、AIが理解しやすい形に文書が整理されていないことにあります。その解決策として注目されているのが「Markdown」です。
本記事では、Markdownが注目される背景と、企業活用のポイントを解説します。
1. Markdownが注目されている背景・メリット
Markdownとは
Markdownは、2004年に米国のブロガーJohn Gruber氏が考案した軽量マークアップ言語です。複雑なタグを使わず、シンプルな記号だけで文書の構造を表現できます。
- GitHubやMicrosoft Learnなど、多くのサービスが標準形式として採用
- 近年はLLMやRAGが扱うデータ形式としても普及
そのまま読み込ませると何が起きるか
WordやExcel、PDFをそのままAIに読み込ませると、レイアウト情報や余白まで解析対象になります。その結果、次のような問題が起こります。
- トークン消費が増え、コストがかさむ
- AIの回答精度が下がる
- 事実と異なる内容を答える「ハルシネーション」が起きやすくなる
次の例を見てください。

この書き方では、「※送料は別途発生します」という注記がどちらの商品を指すのか、AIには判断できません。価格を取り違えれば、誤案内につながりかねません。

見出しと箇条書きで整理すると、AIはどの情報がどの商品に属するかを正しく認識できます。
余分な情報をそぎ落としながら、意味の階層構造を保てる点こそがMarkdown最大のメリットです。
2. Markdownの記述方法
Markdownは、次のような記号だけで文書の構造を表現します。
# 見出し1
## 見出し2
- 箇条書き1
- 箇条書き2
| 商品名 | 価格 |
|---|---|
| 商品A | 10,000円 |
[メディアフュージョン](https://www.mediafusion.co.jp/) - 「#」…見出しの階層
- 「-」…箇条書き
- 「|」…表
- 「[表示文字](リンク先)」…リンク
記号そのものより、見出し・段落・箇条書きという「意味の階層」を意識することが重要です。
3. 既存文書をMarkdownに変換する代表的なOSSツール
社内に蓄積された過去の文書をすべて書き直すのは現実的ではありません。
そこで役立つのが、既存のWordやPDFをMarkdownに変換するOSSツールです。
| ツール名 | タイプ | できること | 課題 |
| Microsoft MarkItDown | ファイル変換 | Word・Excel・PowerPoint・PDFをMarkdownへ一括変換する | 見た目の変換が中心で、文章の意味までは判断しない |
| Unstructured | 構造抽出 | 見出しや表、段組みなど複雑なレイアウトを検出して抽出する | 抽出精度は元文書のレイアウトの規則性に左右される |
| LlamaParse | 構造抽出 | 複雑な帳票やPDFの構造を解析し、整理する | 同上 |
| LangChain MarkdownTextSplitter | 分割(チャンキング) | 見出し単位でテキストを分割し、AIが扱いやすい大きさに整える | 分割の基準が見出しの有無に依存する |
LLMが一度に読み込めるテキスト量には上限があります。そのため、意味のまとまりごとに分割(チャンキング)してから渡す必要があります。
見出し単位で分割すれば、文脈が途中で途切れにくくなります。
ただし、これらのツールは万能ではありません。ツールが行うのは、あくまで見た目上の変換です。
元の文書が段落や見出しで整理されていなければ、変換後のMarkdownも同じように整理されません。
特に、次の作業は既存ツールが苦手とする領域です。
- 文章の意味を理解して要点を抜き出す
- 見出しや箇条書きに書き直す
この壁を越える鍵は、生成AIを活用した変換になりそうです。この点は、機会があれば別の記事でご紹介します。
4. Markdownを書く代表的なOSSエディタ
記号を意識せずに書ける、Markdownエディタも増えています。
| タイプ | 代表的なツール | 特徴 |
| アウトラインプロセッサ型(Markdown保存) | Logseq | 箇条書きとインデントで階層を作るだけで書け、保存されるファイルの実体はそのままMarkdown。#記号を意識する必要がない |
| WYSIWYG型 | Typora、Obsidianなど | 見出しやリストが自動整形され、記法を意識せず執筆できる。保存形式は通常の.md |
| 階層確認型 | Obsidianの「アウトライン」機能 | 執筆中の見出し階層をサイドパネルにツリー表示し、意味階層が整理できているかをその場で確認できる |
アウトライン感覚で書くだけで、裏側では自動的にMarkdownとして保存される。そんな体験に最も近いのがLogseqです。
- 箇条書きとインデントで階層を作るだけでよい
- 「##」のような記号を意識する必要がない
- 保存されるファイルの実体は、そのままMarkdown
ただし、Markdownで保存した文章をそのままWordやPowerPointに貼り付けると、書式が崩れることがあります。貼り付け前に、体裁を軽く整える一手間はまだ必要です。
意味階層を確認したいだけなら、Obsidianの「アウトライン」機能でも十分です。見出し構造をツリー表示し、その場で階層を確認できます。
大切なのは記法を覚えることではなく、意味の階層を意識して簡潔に書く習慣です。
まずは、普段使うWord、PowerPoint、Outlookのテンプレートや、社内の文書作成ルールを整備するところから始めるのも一つの方法です。
まとめ
AIに知識として活用してもらうには、文書をMarkdown、あるいはMarkdownに変換しやすい形で書き、蓄積していくことが重要です。
そのために欠かせないのが、社内文書の意味の階層をきちんと考えて書く工夫です。具体的には、次の取り組みが有効です。
- 適切な見出し階層・箇条書き・表・リンクを備えた文書テンプレートを用意する
- 文書作成ルールを整備する
- 最初からMarkdownエディタで書く
Markdown形式を強く意識したい場合は、エディタを活用するとよいでしょう。
次回は、Markdownよりも表現力を高めた「YAML」を解説します。YAMLはデータ型やネスト構造を表現でき、システムが読み込む定義に向いた形式です。
その次の回では、「Open Knowledge Format(OKF)」を取り上げます。AIによる検索・抽出・要約の精度を高める考え方をご紹介します。
メディアフュージョンでは、社内文書の整備からAI活用を支援しています。詳しくはこちらをご覧ください:民間企業・大学・研究所の業務効率化を加速|AIソリューション(生成AI)|株式会社メディアフュージョン
