DOCX → HTML

Documento do Word em HTML.
Sem o entulho do Word.

Salvar como página da web produz milhares de linhas de estilo mso-. Isto produz marcação como a que você escreveria à mão.

Títulos viram <h2>, tabelas viram <table>, e nada específico da Microsoft sobrevive.

Solte um arquivo aqui.

Ou escolha pelo botão. Ou simplesmente cole com Ctrl+V. Dezenas de uma vez não é problema.

.docx .doc / 25 MB por arquivo / roda no seu navegador, nada é enviado

Outros formatos: .md .markdown .txt .mdown MD → HTML · .txt .text Texto → HTML · .txt .csv .tsv CSV → tabela · .html .htm Google Docs → HTML · .xlsx Excel → tabela · .pdf docstomd.com

Saída
Saída
Indentação
Imagens

Como funciona

  1. 01Solte um .docx na área acima, ou clique para escolher. Dezenas de uma vez não é problema.
  2. 02O Mammoth lê a estrutura do documento — níveis reais de título, tabelas reais, listas reais — e escreve HTML a partir dela. Esse HTML passa depois pelo DOMPurify, porque a própria documentação do Mammoth diz explicitamente que a saída dele não é higienizada.
  3. 03Decida o que fazer com as imagens e copie o HTML, baixe o arquivo ou leve um zip com as imagens ao lado.

O que funciona

  • Todo .docx que o Word escreveu desde 2007, além do Word Online e do Word para Mac
  • Os .doc antigos do Word 97–2003, identificados pelo cabeçalho do arquivo e não pela extensão
  • Níveis de título como <h1>–<h6>, tirados dos estilos do Word e não adivinhados pelo tamanho da fonte
  • Tabelas como <table>, listas como <ul>/<ol> com aninhamento real, links, negrito, itálico e riscado
  • Citações, parágrafos com estilo de código como <pre><code> e legendas como <p class="caption">
  • Imagens embutidas: em base64, extraídas para uma pasta images/ no zip, ou descartadas

O que não faz

  • A formatação visual do Word (fontes, cores, espaçamento exato) não é transportada, e isso é deliberado
  • Células mescladas perdem colspan e rowspan; cada célula passa a ser um <td> próprio
  • Controle de alterações e comentários são descartados — você recebe o texto final, não o histórico de edição
  • Caixas de texto, SmartArt e gráficos não sobrevivem; só o texto deles, quando existe
  • Dos .doc antigos não saem imagens — aquele formato as guarda onde um navegador não alcança
  • Documentos criptografados são recusados em vez de lidos pela metade

O que vai para o lixo

Word e Google Docs embrulham o conteúdo numa camada de entulho que só significa algo dentro do editor deles. Isso sai.

A estrutura fica: títulos continuam títulos, tabelas continuam tabelas, listas continuam listas. O que sai é a decoração.

Perguntas que chegam aqui

A exportação do Word quer que a página fique idêntica num navegador, então ela escreve um bloco enorme de CSS, um atributo de estilo mso- em quase todo elemento, nomes de classe como MsoNormal e tags exclusivas do Office como <o:p>. Isto faz o oposto: lê a estrutura e joga fora a apresentação. Você recebe algumas dezenas de linhas de HTML semântico em vez de alguns milhares de linhas de marcação que não dá para editar.

Indo no sentido oposto?

O DocsToMD é esta mesma ferramenta ao contrário: Word, PDF, Excel e HTML para Markdown. Mesma abordagem, mesmo modelo de privacidade, saída inversa.

docstomd.com