Huashu MD/HTML(花叔 md/html/docx 文档流水线)
花叔的「md为源、多端消费」文档流水线:markitdown 万物转 md、pandoc+4套反AI-slop主题出精美 html(零token兜底+设计师定制双模式)、trafilatura 网页无损转回 md、python-docx 一条命令产出出版社级 docx 审校稿。
仓库:alchaincyf/huashu-md-html
热度证据:话术家系列文档转换技能
五维评分
热度4/5
质量5/5
创新4/5
易用4/5
文档5/5
优秀点拆解
- 能力路由决策表:SKILL.md 开头用表格固化「用户说什么→走哪个能力→用什么脚本」,URL 场景再按实测数据(证书页 markitdown 192行 vs trafilatura 87行)提炼出「读→去噪、查→保信息」的判断捷径,agent 查表即达、无需猜
- Token 成本显式分级:默认 pandoc 兜底路径零 token 5秒出活,AI 设计师模式(阅读→推荐3方向→拍板→实现)作为显式升级选项,把快与美解耦、成本决策前移
- 审美底线固化为必须/禁止检查表:继承 huashu-design 反 AI slop 清单,配色/字体/图标/容器/装饰/节奏六类逐一枚举禁用项(紫渐变、emoji作图标、#0D1117深蓝底),主观审美变成可勾选执行的客观约束,保证品牌识别度
- 环境自检+显式异常表:每个脚本启动检测依赖、缺失打印精确安装命令而非堆栈报错,连 macOS pip/python3 版本错位踩坑都写进文档,失败可预期可自助
- 出版级 docx 的交付对象洞察:拒绝 pandoc 默认 docx(Calibri 生硬版式),独立实现出版社版式语言(大32开、章号小标、emoji引用块配色、封面目录页眉页脚、--book 整书模式),用158页出版社审校稿实战验证
可复用的设计模式
- 「md 为源、多端消费」:创作全在 md,按消费场景选产物格式(html 自看分享 / docx 出版交付),转换双向可逆形成采集→整理→发布→归档闭环
- 能力路由表 + 一句判断捷径:自然语言到工具选择的映射固化为表格,模糊场景配一条可记忆启发式,agent 查表执行
- Token 成本分级双路径:零 token 确定性工具路径为默认,AI 介入作为带触发条件的可选升级,成本决策前置
- 质量标准写成必须/禁止对照表 + 深度文档下放 references/ cookbook:主文档只放决策/路由/底线三要素,按任务路由表取深层细节
适用场景
资料采集:PDF/DOCX/PPTX/XLSX/EPUB/图片/音频/YouTube/网页 URL 一条命令转成干净 md 再加工内容发布:md 用 article/report/reading/interactive 四主题出精美 html,公众号转接、博客、白皮书、长书导航各有对应主题出版交付:整本 md 章节一条命令合并成出版社审校 docx(封面+目录+页眉页脚+自动嵌图),投稿/纸质书定稿网页归档:把已发布的博客/文章 URL 用 trafilatura 去噪后转回 md 存入项目源,实现反向归档
边界与注意:转换保真度受 markitdown 上限约束(扫描PDF无OCR、复杂表格丢语义、PPTX丢动画);需 brew 装 pandoc + 多个 pip 包,首次环境搭建多步;LLM 图片描述绑定 OPENAI_API_KEY;审美底线是花叔个人品牌向的,复用者需自换 design-tokens
完整拆解分析文档
本页为摘要版,完整精读分析(核心机制、逐条优秀点拆解、写作过程)见本地 Markdown 文档:
analysis/huashu-md-html.md