我每周都要处理大量 Word 文档——合同、诉状、尽调报告、法律意见书。这些文档在人类同事和客户之间流转顺畅,批注、修订、签字、盖章,一切正常。
但一丢给 AI,问题就来了:条款编号丢了,表格读乱了,修订痕迹和正文混在一起,页眉里的合同编号直接消失。
不是 AI 不行。是 .docx 这个格式,从一开始就没打算给机器读。
.docx 是一个以"视觉排版还原"为核心目标的复杂文档容器。AI 喜欢的是"语义清晰、结构稳定、文本连续、差异可比"的格式。两者目标天然冲突。
打个比方:.docx 像一个装修完成的办公室——人走进去很舒服,知道哪里是会议室、哪里是前台。但 AI 要的是建筑图纸:房间 A 是会议室,30 平米,位于一层东侧,相邻走廊和茶水间。Word 给你看装修效果,AI 要的是 CAD。
一、自己动手拆一个 .docx
在讲原理之前,先做一件事——这件事比任何解释都有说服力。
你手边随便找一份 .docx 文件,合同、报告、诉状都行。然后:
第一步,复制一份(别直接改原文件):
合同.docx→ 复制为 →合同-拆解用.docx
第二步,把扩展名改成 .zip:
合同-拆解用.docx→ 改名 →合同-拆解用.zip
第三步,双击解压。
你会看到这些东西:
你亲手拆过一次之后,很多事情就清楚了:.docx 不是一个"文档文件",而是一个"压缩后的文档工程包"。正文、样式、编号、批注、图片、页眉页脚分散在十几个文件里,靠关系文件(.rels)把它们串在一起。
注意:只有 .docx 能这样拆。老式 .doc 是二进制格式,改成 .zip 解不开。同样 .pptx 和 .xlsx 也是 ZIP + XML,都适用这套操作。
二、人类为什么离不开 Word?
因为它解决的是办公世界最重要的问题:文档看起来对不对,能不能打印,能不能签字,能不能交付。
所见即所得——你看到什么,打印出来就是什么。合同里的页眉页脚、页码、首行缩进、签字页位置、盖章空间,这些东西在 Markdown 和纯文本里都是灾难。
修订和批注——法律场景里这几乎是不可替代的。律师、客户、对方律师都能看到:谁删了哪句话,谁加了什么,批注里写了什么意见,修订接受了没有。这是 Word 在商业协作里的核心壁垒。
它承载的是"文档状态"——这个编号是不是自动编号,这个表格是不是跨页,这个脚注是不是对应正文,这个页眉是不是只在首页不同,这个条款是不是还保留着谈判痕迹。对人来说这是完整的文档感知,但对 AI 来说,这里面大量信息是噪声。
三、AI 为什么头疼?
五个核心原因。
1. 文本不连续。 AI 要的是连续、线性的文字流。但 .docx 里同一句话可能被拆成三四个 run——只是因为字体变了、加粗了、有拼写检查标记、中英文混排、或者复制粘贴带入了格式。人眼看是一句话,机器看是一堆碎片。
2. 结构和视���混在一起。 AI 想知道"这是标题""这是正文""这是引用"。但 Word 告诉你的是"这行字加粗了""这行缩进了 2 字符""这段段前距 12 磅"。更麻烦的是,很多人不用"标题 1"样式,而是手动把一行字加粗放大——人类看起来是标题,机器看到的只是一段格式特殊的大号文字。
3. 样式信息大量冗余。 同一句话在 .docx 里可能附带几十行字体、颜色、间距、语言的 XML 标签。这些对排版有用,对理解内容没用,但清洗起来很费劲。
4. 信息散落在十几个文件里。 正文在 document.xml,图片在 media/,脚注在 footnotes.xml,批注在 comments.xml,页眉在 header1.xml,超链接关系在 .rels 里。AI 想"完整理解"一份文档,得自己判断:页眉读不读?批注读不读?修订前还是修订后?文本框里的字算不算正文?表格按行还是按列?没有标准答案。
5. 版本管理极不友好。 .docx 是 zip 包。Git 看到它只会说 Binary files differ。哪怕你只改了一个字,压缩包内部也可能整体变化。Word 自己有"修订模式"和"比较文档",但那是 Word 生态内的机制,不是通用版本控制。
四、法律场景下问题更大
法律文档对结构的要求比普通文档高得多。合同、诉状、代理意见、判决书,核心信息严重依赖条款编号、层级结构、表格、批注和修订痕迹。而 .docx 的复杂性在法律场景里会被放大:
条款编号丢失。 你看到"第三条 付款条件",AI 提取后可能只剩"付款条件"。因为编号可能是 numbering.xml 动态生成的,不是正文文字。引用直接错位。
表格读取错位。 付款节点 | 付款比例 | 付款条件——这个三列关系在 AI 提取后可能变成一串无结构的文字流,法律含义完全改变。
修订痕迹的不确定。 谈判稿里一方删了"不承担违约责任",但修订还没接受。AI 到底读删除前的还是删除后的?读错了,结论就反了。
页眉页脚的关键信息。 合同编号、项目名称、版本号、保密标识——经常在页眉页脚里,普通提取器直接跳过。
批注里的谈判信息。 法律文档的批注不是普通备注,里面可能有律师意见、风险提示、客户决策、对方让步和谈判底线。只读正文不读批注,丢掉了最重要的上下文。把批注当正文,又污染了正式文本。
五、Markdown / HTML / TXT 为什么更适合 AI?
这三种格式的共同特点是:文本连续,语义明确,结构稳定,版本差异可追踪。
Markdown 是最理想的中间格式。# 就是标题,- 就是列表,> 就是引用。没有隐藏信息,没有排版噪声,Git diff 清清楚楚。AI 读起来最省力。
HTML 比 Markdown 对表格和链接的支持更完整。 明确告诉机器"这是一级标题",不会跟加粗文字搞混。
纯文本 最朴素但最稳定。不会隐藏内容,不会携带格式噪音,任何系统都能读。代价是结构弱,得靠人为规范来补。
六、"人喜欢"和"AI 喜欢"为什么正好相反?
| 维度 | 人喜欢 Word 的原因 | AI 不喜欢 Word 的原因 |
|---|---|---|
| 排版 | 所见即所得,能打印能签字 | 排版信息过多,干扰语义 |
| 修订 | 方便审阅和谈判 | 修订前后文本混杂 |
| 批注 | 协作讨论很方便 | 批注和正文边界不清 |
| 表格 | 视觉上很清楚 | 提取后结构错乱 |
| 编号 | 自动编号省事 | 编号可能不是正文 |
| 图片 | 直接嵌入截图扫描件 | 需要额外 OCR |
| 版本 | Word 内部能比较 | Git 外面没法 diff |
| 文件 | 一个文件好传输 | 实际是复杂 zip 工程包 |
核心矛盾一句话:人类靠视觉理解文档,AI 靠结构和文本理解文档。Word 强在视觉,弱在结构稳定性。
回到开头那个比喻——人需要装修好的办公室,AI 需要建筑图纸。两种需求都是真实的,但服务于完全不同的目的。
七、实际怎么做?
不要幻想"不用 Word"。在法律行业不可能。
更务实的策略是建立一条转换流水线:
Word 接收材料 → 转 Markdown / HTML / JSON → AI 分析处理 → 生成结果 → 回写 Word → PDF 固化交付
也就是三层分工:
- 人类协作层:docx(接收、修订、交付)
- 机器处理层:md / html / json(AI 分析、比对、提取)
- 最终交付层:docx / pdf(签字、盖章、归档)
转换工具的选择取决于目的:普通文本分析转 Markdown 就够了;需要保留表格和页面结构用 HTML;做条款数据库和 RAG 检索用 JSON。
这篇文章本身就是一个例子——我用 Markdown 写的,结构干净,改起来方便,发到公众号时再转成微信 HTML。如果一开始用 Word 写,中间每一步都要多花时间清洗格式。
八、一句话总结
.docx 不是文本文件,是页面排版容器。它和人办公的习惯严丝合缝,和 AI 的工作方式处处冲突。
不怪 Word,也不怪 AI。它们本来就是在为两个不同的读者服务。
作者简介: 陈石律师,浙江海泰律师事务所副主任、高级合伙人、房地产与建设工程部主任,宁波市律师协会副秘书长、第七届宁波仲裁委员会仲裁员,聚焦建筑房地产、投融资、并购重组及商事争议解决。曾获多家法律媒体与专业机构认可,荣登 LegalOne 2025 中国区建工及房地产实务先锋 45 强、律新社 2025 年度管理合伙人 20 佳(华东),入选《商法》The A-List 法律精英,获评 ALB China 区域市场十五佳长三角地区律师新星,并获律新社 2024 年度并购领域品牌之星。长期为万科、华润置地、信达地产、保利置业、招商蛇口、中海地产等企业提供法律服务,承办"首宗百亿地王""长春第一高楼""台州第一高楼"等代表性项目,累计服务项目投资额超千亿。近年来持续推动 AI 与法律实务融合,强调以结构化方法打通技术逻辑、法律判断与商业场景;著有《赋能法律人:AI 底层思维与应用范式》,并在多地开展相关主题讲座与分享。四明山法师 AI 夜校(legalAGI.cn)发起人。