DOCX → HTML
Documento do Word em HTML.
Sem o entulho do Word.
Salvar como página da web produz milhares de linhas de estilo mso-. Isto produz marcação como a que você escreveria à mão.
Títulos viram <h2>, tabelas viram <table>, e nada específico da Microsoft sobrevive.
Solte um arquivo aqui.
Ou escolha pelo botão. Ou simplesmente cole com Ctrl+V. Dezenas de uma vez não é problema.
.docx .doc / 25 MB por arquivo / roda no seu navegador, nada é enviado
Outros formatos: .md .markdown .txt .mdown MD → HTML · .txt .text Texto → HTML · .txt .csv .tsv CSV → tabela · .html .htm Google Docs → HTML · .xlsx Excel → tabela · .pdf docstomd.com
Como funciona
- 01Solte um .docx na área acima, ou clique para escolher. Dezenas de uma vez não é problema.
- 02O Mammoth lê a estrutura do documento — níveis reais de título, tabelas reais, listas reais — e escreve HTML a partir dela. Esse HTML passa depois pelo DOMPurify, porque a própria documentação do Mammoth diz explicitamente que a saída dele não é higienizada.
- 03Decida o que fazer com as imagens e copie o HTML, baixe o arquivo ou leve um zip com as imagens ao lado.
O que funciona
- Todo .docx que o Word escreveu desde 2007, além do Word Online e do Word para Mac
- Os .doc antigos do Word 97–2003, identificados pelo cabeçalho do arquivo e não pela extensão
- Níveis de título como <h1>–<h6>, tirados dos estilos do Word e não adivinhados pelo tamanho da fonte
- Tabelas como <table>, listas como <ul>/<ol> com aninhamento real, links, negrito, itálico e riscado
- Citações, parágrafos com estilo de código como <pre><code> e legendas como <p class="caption">
- Imagens embutidas: em base64, extraídas para uma pasta images/ no zip, ou descartadas
O que não faz
- A formatação visual do Word (fontes, cores, espaçamento exato) não é transportada, e isso é deliberado
- Células mescladas perdem colspan e rowspan; cada célula passa a ser um <td> próprio
- Controle de alterações e comentários são descartados — você recebe o texto final, não o histórico de edição
- Caixas de texto, SmartArt e gráficos não sobrevivem; só o texto deles, quando existe
- Dos .doc antigos não saem imagens — aquele formato as guarda onde um navegador não alcança
- Documentos criptografados são recusados em vez de lidos pela metade
O que vai para o lixo
Word e Google Docs embrulham o conteúdo numa camada de entulho que só significa algo dentro do editor deles. Isso sai.
A estrutura fica: títulos continuam títulos, tabelas continuam tabelas, listas continuam listas. O que sai é a decoração.
- Tags <script>
- onclick e parentes
- Estilos mso- inline
- Classes c1 / c17 mortas
- Parâmetros de rastreamento
- Tags exclusivas do Office
- Preservado: a estrutura semântica
- Escapado: & < > e as aspas
Perguntas que chegam aqui
Indo no sentido oposto?
O DocsToMD é esta mesma ferramenta ao contrário: Word, PDF, Excel e HTML para Markdown. Mesma abordagem, mesmo modelo de privacidade, saída inversa.