DOCX → HTML

Documento de Word a HTML.
Sin la basura de Word.

Guardar como página web produce miles de líneas de estilos mso-. Esto produce marcado como el que escribirías a mano.

Los títulos se vuelven <h2>, las tablas <table>, y no sobrevive nada específico de Microsoft.

Suelta un archivo aquí.

O elígelo con el botón. O simplemente pega con Ctrl+V. Decenas a la vez no es problema.

.docx .doc / 25 MB por archivo / corre en tu navegador, nada se sube

Otros formatos: .md .markdown .txt .mdown MD → HTML · .txt .text Texto → HTML · .txt .csv .tsv CSV → tabla · .html .htm Google Docs → HTML · .xlsx Excel → tabla · .pdf docstomd.com

Salida
Salida
Sangría
Imágenes

Cómo funciona

  1. 01Suelta un .docx en la zona de arriba, o pulsa para elegirlo. Decenas a la vez no es problema.
  2. 02Mammoth lee la estructura del documento (niveles de título reales, tablas reales, listas reales) y escribe HTML a partir de ella. Ese HTML pasa después por DOMPurify, porque la propia documentación de Mammoth dice explícitamente que su salida no está desinfectada.
  3. 03Decide qué hacer con las imágenes y copia el HTML, descarga el archivo o llévate un zip con las imágenes al lado.

Qué se admite

  • Todos los .docx que Word ha escrito desde 2007, además de Word Online y Word para Mac
  • Los .doc antiguos de Word 97–2003, detectados por la cabecera del archivo y no por la extensión
  • Niveles de título como <h1>–<h6>, tomados de los estilos de Word y no adivinados por el tamaño de letra
  • Tablas como <table>, listas como <ul>/<ol> con anidamiento real, enlaces, negrita, cursiva y tachado
  • Citas, párrafos con estilo de código como <pre><code> y leyendas como <p class="caption">
  • Imágenes incrustadas: en base64, extraídas a una carpeta images/ para el zip, o descartadas

Qué no hace

  • El formato visual de Word (tipografías, colores, espaciado exacto) no se traslada, y es deliberado
  • Las celdas combinadas pierden colspan y rowspan; cada celda pasa a ser su propio <td>
  • El control de cambios y los comentarios se descartan: recibes el texto final, no el historial de edición
  • Los cuadros de texto, SmartArt y gráficos no sobreviven; solo su texto, si lo hay
  • De los .doc antiguos no salen imágenes: ese formato las esconde donde un navegador no llega
  • Los documentos cifrados se rechazan en lugar de leerse a medias

Qué se tira a la basura

Word y Google Docs envuelven el contenido en una capa de basura que solo significa algo dentro de su propio editor. Se va.

La estructura se queda: los títulos siguen siendo títulos, las tablas tablas y las listas listas. Lo que se elimina es la decoración.

Preguntas que nos hacen

La exportación de Word busca que la página se vea idéntica en un navegador, así que escribe un bloque enorme de CSS, un atributo de estilo mso- en casi todos los elementos, nombres de clase como MsoNormal y etiquetas exclusivas de Office como <o:p>. Esto hace lo contrario: lee la estructura y tira la presentación. Recibes unas decenas de líneas de HTML semántico en lugar de unos miles de líneas de marcado que no puedes editar.

¿Vas en la otra dirección?

DocsToMD es esta misma herramienta al revés: Word, PDF, Excel y HTML a Markdown. Mismo enfoque, mismo modelo de privacidad, salida opuesta.

docstomd.com