DOCX → HTML
Word 文書を HTML に。
Word のゴミは置いていきます。
「Web ページとして保存」は mso- スタイルを何千行も吐きます。これは手で書いたようなマークアップを出します。
見出しは <h2> に、表は <table> に。Microsoft 固有のものは一つも残りません。
ここにファイルを落としてください。
ボタンから選んでも、Ctrl+V で貼り付けても構いません。何十個まとめてでも大丈夫です。
.docx .doc / 1 ファイル 25 MB まで / ブラウザで処理、何も送信しません
ほかの形式は: .md .markdown .txt .mdown MD → HTML · .txt .text テキスト → HTML · .txt .csv .tsv CSV → 表 · .html .htm Google ドキュメント → HTML · .xlsx Excel → 表 · .pdf docstomd.com
出力
出力
字下げ
画像
使い方
- 01.docx を上の枠に落とすか、押して選んでください。何十個まとめてでも大丈夫です。
- 02Mammoth が文書の構造 — 本当の見出しレベル、本当の表、本当のリスト — を読み、そこから HTML を書きます。その HTML はそのあと DOMPurify を通します。Mammoth 自身の説明書が、出力は無害化されていないと明記しているからです。
- 03画像の扱いを決めて、HTML をコピーするか、ファイルを保存するか、画像を添えた zip を持ち帰ってください。
対応していること
- 2007 年以降に Word が書いた .docx すべて。Word Online と Mac 版 Word も含みます
- Word 97〜2003 の古い .doc。拡張子ではなくファイル先頭の署名で判定します
- 見出しレベルは <h1>〜<h6> に。文字サイズからの推測ではなく Word のスタイル情報から取ります
- 表は <table>、リストは本当の入れ子を保った <ul>/<ol>、リンク、太字、斜体、打ち消し線
- 引用、コードスタイルの段落は <pre><code>、図表番号は <p class="caption">
- 埋め込み画像:base64 にする、zip 用に images/ フォルダへ取り出す、または捨てる
できないこと
- Word の見た目(フォント、色、正確な余白)は持ち込みません。これは意図した設計です
- 結合セルは colspan と rowspan を失い、各セルがそれぞれの <td> になります
- 変更履歴とコメントは落とします。編集の履歴ではなく、最終の本文が手に入ります
- テキストボックス、SmartArt、グラフは残りません。中の文字だけ、あれば残ります
- 古い .doc から画像は出せません。あの形式はブラウザが届かない場所に画像を隠します
- 暗号化された文書は、中途半端に読むのではなく受け付けません
捨てているもの
Word と Google ドキュメントは、自分のエディタの中でしか意味を持たないゴミの層で本文を包んでいます。それを落とします。
構造は残ります。見出しは見出しのまま、表は表のまま、リストはリストのまま。落ちるのは装飾だけです。
- <script> タグ
- onclick とその仲間
- インラインの mso- スタイル
- 死んだ c1 / c17 クラス
- トラッキングパラメータ
- Office 専用のタグ
- 残すもの:意味のある構造
- エスケープ:& < > と引用符
よく届く質問
Word の書き出しは、ブラウザで見たときに元と同じに見えることを目指します。だから巨大な CSS の塊を書き、ほぼすべての要素に mso- のスタイル属性を付け、MsoNormal のようなクラス名と <o:p> のような Office 専用タグを残します。こちらは逆をやります。構造を読み、見た目を捨てます。編集できない何千行のマークアップではなく、数十行の意味のある HTML が手に入ります。
逆方向をお探しですか
DocsToMD は同じ道具を逆向きにしたものです。Word、PDF、Excel、HTML から Markdown へ。同じ作り、同じプライバシーの考え方、出力だけが逆です。