Google Docs → HTML
Google 文档转 HTML。
不要那堆类名。
从文档里复制出来的 HTML,裹着一层类名,而那份样式表你手上并没有。
粘到这里,剩下的就是文档本身:标题、列表、表格、链接。
把文件拖到这里。
也可以点按钮选,或者直接 Ctrl+V 粘贴。一次几十个都行。
.html .htm / 单个文件 25 MB / 在你浏览器里跑,不上传
别的格式: .md .markdown .txt .mdown MD → HTML · .txt .text 文本 → HTML · .txt .csv .tsv CSV → 表格 · .docx .doc DOCX → HTML · .xlsx Excel → 表格 · .pdf docstomd.com
或者粘贴到这里
在文档里选中正文复制 —— 不是复制分享链接。然后粘到下面,或者在本页任意位置按 Ctrl+V。
输出设置
输出形态
缩进
怎么用
- 01打开文档,选中正文,复制。然后粘进下面的框,或者在本页任意位置按 Ctrl+V —— 浏览器会把一份富文本放进剪贴板,读的就是它。
- 02先过 DOMPurify,因为剪贴板里的 HTML 可能来自网上任何一个页面。接着清掉 Google 专属的那些东西:c1/c17 类名、Docs 给整篇文档套上的 <b style="font-weight:normal"> 外壳、docs-internal-guid 这类 id,以及每个链接外面那层 google.com/url?q= 跳转。
- 03在 sandbox 预览里确认一下,然后复制 HTML 或者存成文件。
支持什么
- 从 Google Docs、Word Online、Notion 或其他网页编辑器直接复制的富文本
- 当成文字粘进来的 HTML 源码,以及存下来的 .html 文件
- 标题、段落、带真实嵌套的列表、表格、链接、粗体、斜体、删除线
- 拆掉 Docs 套在整篇文档外面那个毫无意义的 <b style="font-weight:normal">
- 把 google.com/url?q= 跳转还原成你当初真正链接的那个网址
- 清掉文档内链接上的 utm_ 等跟踪参数
做不到什么
- 不连接你的 Google 账号 —— 这里的任何东西都看不到你的云端硬盘
- 粘贴带不过来图片:剪贴板里只是指向 Google 服务器上的地址
- 批注和建议修改会丢掉,复制之前先处理完
- 图表、绘图和智能条目最多剩下纯文字
- 如果你复制的是分享链接而不是正文,那能转的就只有一个链接
- Google 自己那套字体和配色,会跟其余样式一起被清掉
哪些东西被扔掉了
Word 和 Google Docs 都会给正文裹上一层垃圾,那层东西只在它们自己的编辑器里有意义。这里一律清掉。
结构留着:标题还是标题,表格还是表格,列表还是列表。删掉的是装饰。
- <script> 标签
- onclick 这类事件属性
- 行内 mso- 样式
- 失效的 c1 / c17 类名
- 链接里的跟踪参数
- Office 专属标签
- 保留:语义结构
- 转义:& < > 和引号
常见问题
因为它本来就不是给你读的。Docs 会写一份满是 .c1、.c17 这类规则的样式表,然后给每个元素挂上对应的类名。你把正文复制出来,类名跟着走了,样式表没跟着走 —— 于是标记上全是现在毫无意义的类名。再往上还有一个把整篇文档包住的 <b style="font-weight:normal">,它在格式上什么都没做;每个链接则被改写成经由 google.com/url?q= 跳转。
想反着转?
DocsToMD 是同一套东西反过来用 —— Word、PDF、Excel、HTML 转成 Markdown。做法一样,隐私模型一样,只是输出格式相反。