Install
corallibra / 网页内容提取器(Extract Page Content)

Published:

Version: 2.1+9914f8a updated

Summary: Extract Page Content to Single File (with Base64 Images). Extracts visible page content including images (converted to Base64) into a single downloadable Markdown file.

License: GPL-3.0-or-later

Antifeature: unspecified

将当前浏览页面内容完整抓取方案,采用Markdown核心引擎,智能地识别HTML 标签并转换为对应的 MD 语法。
油猴脚本运行在浏览器沙箱中,没有文件系统操作的权限,不能在本地创建文件夹并将多个文件(HTML和图片等)分别保存到其中。它只能生成并触发一个文件的下载。
这是浏览器原生功能,需要通过浏览器的菜单操作。 例如,在 Edge/Chrome 中:右键点击页面 -> 另存为... -> 保存类型选择“网页,完整(.htm;.html)”。
鉴于油猴脚本的局限性,单文件 HTML(包含 Base64 图片) 的方案会导致文件过大,浏览器假死等问题。Base64 图片本身仍然是 HTML 文件体积大的主要原因,文件越大,浏览器解析和渲染所需的时间就越长。而将页面转换为 Markdown 是解决“文件过大、打开卡顿、加载不全”的最佳方案。
Markdown 是纯文本,体积极小,且图片以链接形式加载。
秒开:文件只有几十 KB。
图源引用:直接使用原站图片地址,不占本地空间。
易于编辑:你可以方便地在 Obsidian、Notion、Typora 或 VS Code 中查看和二次整理。
提取过程的不同阶段提示:
“克隆页面内容...”
“清理脚本元素和不必要内容...”
“正在处理图片:1 / 100 张” (这个会在每张图片处理完成后更新)
“嵌入样式表...”
“生成最终Markdown文件...”
文件名格式化:输出 20260103T1348 这种格式。
标题清洗优化:处理掉所有操作系统不允许作为文件名的特殊符号,同时将空格替换为下划线,确保下载时不会报错。
极简命名:最终输出的文件名严格对应您的要求,例如:XXXX_20260103T1348.md。

说明:
Markdown 核心引擎:识别 HTML 标签并转换为对应的 MD 语法。
图片显示:自动将所有链接补全为 https://domain.com/img/photo.jpg。
极速提取:不再需要将图片一张张转成巨大的 Base64 字符串,提取过程通常在 1-2 秒内完成。
文件极小:生成的 .md 文件通常只有几 KB 到几十 KB,任何文本编辑器都能秒开。
自动清理:脚本会自动尝试过滤掉网页的页眉(Header)、页脚(Footer)和侧边栏(Aside),尽可能只保留文章主体内容。
不会卡顿: Markdown 是纯文本,浏览器或编辑器处理它非常轻松。
兼容性强:如果你使用 Obsidian 或 Notion,你可以直接把这个 .md 文件拖进去,它会自动解析所有的图片链接。
稳定性:避开了 Base64 编码导致的内存溢出问题。
使用方法:页面右上角生成悬浮按钮 “📝 提取为 Markdown”。
点击即可直接提取当前页面并自动下载,在 Obsidian、Notion、Typora 或 VS Code 中查看和二次整理。

Rating: 0