99% 的人以为「能上传 PDF」就等于「什么 PDF 都能看懂」。但在这次 DeepSeek 实测里,同一个图表文件,在 Instant 模式只拿到 1/10 分,换到 Vision 却直接 10/10。模式选错,比模型本身更容易毁掉你的工作流。下面这 10 个真实任务,会把 DeepSeek 的 PDF 能力拆开给你看:哪里靠谱,哪里必须小心。

本文所有测试文件均为人工合成,不含真实个人、财务、客户或机密信息;测试由 Chat Deep AI 独立完成,与 DeepSeek 官方无关。

整体结果先说结论:在 10 个可控任务中,DeepSeek Chat 的产品工作流总分为 89/100。其中,模型在 9 个实际提交任务中拿到 84/95,加密文件安全防护拿到 5/5。如果把失败的图表任务改用 Vision 诊断结果替换,后验得分可以到 98/100,但那已经超出原始测试设计,只能当作敏感性分析。

DeepSeek Chat web interface showing Instant, Expert, and Vision modes

测试设计与评分逻辑

测试方法:先定答案,再开模型

你是不是也遇到过这种情况:模型回答看着挺对,但你根本没法量化它到底「多对」?为了避免这种主观印象,我们在打开 DeepSeek 之前,就为每个文件先写好了「标准答案」。

每个 PDF 或文件都预埋了:

  • 明确的数值、日期、金额或代码
  • 指定页码位置
  • 修订条款的优先级
  • 以及刻意设计的「诱饵信息」和失败条件

所有评分只看一条:模型给出的值是否与文件内容精确匹配。对就是对,错就是错,不靠感觉打分。每个主要测试都从全新对话开始,关闭搜索功能,确保回答完全基于上传文件,而不是外部知识或网络信息。

在这轮测试中:

  • 10 个计分任务中,Instant 是主力模式
  • 文件上传入口在 Instant 和 Vision 中可用,在 Expert 中不可用
  • 3 个任务在新对话中重复执行,用来检查稳定性

我个人在复盘时发现,很多人会误以为「能看到附件卡片」就代表文件已经解析完,这个假设在这里被推翻了:有几次发送按钮其实还处于不可用状态,说明解析还在后台进行。

A searchable PDF attached to a new DeepSeek Instant chat

评分规则:10 分制 + 特殊任务加权

评分采用加权制:

  • 8 个常规任务:每个 10 分
  • 1 个 30 页长文档检索任务:15 分,因为涉及跨页检索与修订计算
  • 1 个加密 PDF 安全失败任务:5 分,正确行为是「拒绝处理且不编造内容」

有几个细节容易被忽略:

  • 即便数值正确,如果引用页码过宽泛,也会扣 1 分
  • 一旦出现「编造文件中不存在的实质内容」,该任务最高只能拿一半分数
  • 轻微格式差异(如日期写法不同)只要语义一致,就算正确

数据显示:在这 10 个任务中,唯一的「硬失败」来自图表识别,而非文本或表格解析,这和很多人直觉正好相反。

10 个任务的详细表现

Test 1:可搜索发票解析 — 9/10

第一个 PDF 是两页的原生文本发票。要求 DeepSeek 提取:发票号、客户名称、到期日、小计、折扣、税额、应付总额,并重新计算最终金额是否正确。

模型给出的所有字段都与原文一致:它验证了 3,630.00 美元减去 180.00 美元折扣,再加上 172.50 美元税额,等于 3,622.50 美元。唯一的扣分点在于证据页标注为 evidence_pages: [1, 2],而所有计分字段都在第 1 页,引用第 2 页显得多余。

DeepSeek returning correct JSON from a searchable invoice PDF

Test 2:政策修订条款 — 10/10

第二个文件是 3 页的资助政策:前两页给出通用申请截止日期、27.5 万美元资助上限、12% 配套比例和联系人信息。第 3 页引入修订:北区机构如果在原截止日前发邮件通知,可获得 5 天延期。

DeepSeek 成功区分了「通用规则」和「有条件例外」,同时返回:

  • 原始截止日期
  • 北区机构的延长期限与触发条件
  • 未改变的资助上限与配套比例
  • 联系人姓名
  • 以及 1、2、3 页的证据引用

准确度满分,不过这一轮响应时间异常:91.8 秒。我们保留了这个慢结果,没有用更快的重跑替换,用来提醒读者:界面偶发延迟也会影响体验。

DeepSeek correctly applying a later policy amendment in a PDF

Test 3:扫描小票 OCR — 10/10

第三个文件是纯图片扫描小票,没有任何可搜索文本。内容包括 3 个商品、36.15 美元小计、2.89 美元税额、39.04 美元总额。

Instant 模式成功识别:

  • 小票编号与日期
  • 每个商品名称与单价
  • 小计、税额与总额
  • 最高单价商品

并且重新计算总额无误。这里有个重要发现:同样是「图片型 PDF」,简单文档 OCR 和复杂图表理解的难度完全不同。后面的图表任务就暴露了这种差异。

DeepSeek extracting line items and totals from an image-only scanned receipt

Test 4:双栏报告 — 10/10

第四个 PDF 把两个项目摘要并排排版,每个项目有不同的负责人、启动日期、预算和风险等级。末尾有一句关键指示:分析师应优先考虑决策关口早 14 天的项目。

DeepSeek 在解析时:

  • 没有把左右两栏的字段混在一起
  • 正确区分 Atlas 与 Beacon 两个项目的 8 个核心字段
  • 识别出 Atlas 的决策关口比 Beacon 早 14 天
  • 并据此选择 Atlas 作为优先项目

DeepSeek keeping two project columns separate in a PDF report

Test 5:财务表格计算 — 10/10

第五个文件是一张季度财务表,包含:毛收入、退货、净收入和销量。任务要求:

  • 计算每个指标的年度合计
  • 找出净收入最高的季度
  • 计算 Q4 与 Q1 的差额
  • 验证年度算术是否自洽

模型给出的结果完全正确:

  • 年度毛收入 535,000 美元
  • 退货 23,000 美元
  • 净收入 512,000 美元
  • 总销量 36,750 件
  • 净收入最高季度为 Q4,金额 143,500 美元
  • Q4 与 Q1 净收入差额 28,500 美元

发送按钮在文件处理期间短暂不可用,真正提交后约 7.5 秒完成回答。

DeepSeek calculating annual figures from a financial table in a PDF

Test 6:30 页长文档检索 — 15/15

第六个任务专门考察长文档检索与修订条款应用。我们在:

  • 第 3 页放入一个业务代码和数量
  • 第 17 页放入第二个代码和退货数量
  • 第 29 页放入预算修订条款

其他页面布满相似文本作为干扰项。

DeepSeek 找到了:

  • 第 3 页的 ORBIT-314 和 127 个单位
  • 第 17 页的 LANTERN-852 和 43 个退货单位
  • 正确计算净数量为 84
  • 并根据第 29 页修订,把 65,000 美元上限替换为 68,750 美元

所有页码引用也都准确无误,这个任务拿到满分 15 分。

DeepSeek retrieving distant facts and an amendment from a 30-page PDF

Test 7:纯图片柱状图 — Instant 1/10,Vision 10/10

第七个任务是整个测试里最有「分裂感」的一次。PDF 只包含一张栅格化柱状图:

  • North:84
  • South:61
  • East:73
  • West:92

衍生问题包括:最高区域、West 与 South 的差值 31、总和 310。

在 Instant 模式下,模型对所有数值都返回 null。我们给了 1 分,只因为它没有乱编数字。随后在新对话中切换到 Vision 模式,上传同一 PDF,用同样的提示词,Vision 在 8.9 秒内返回了全部 4 个原始数值、2 个计算结果和正确页码。

实战启示:不要把「文件上传成功」当成「当前模式能看懂所有视觉元素」的证明。凡是高度依赖图表或图片的 PDF,先用 Vision 在代表性样本上做一轮试跑,再决定是否纳入正式流程。

Test 8:合同修订条款 — 9/10

第八个文件是一份带修订的服务合同。原条款规定:

  • 解约需提前 30 天通知
  • 付款期限为 15 天

后续修订把条款改为:

  • 解约提前 45 天
  • 付款期限 10 天
  • 生效日期为 2026 年 9 月 1 日
  • 保留原有的正式通知邮箱

DeepSeek 正确返回了所有原始与现行条款,并按修订后的条款进行解释。扣分点依旧出在证据页:它把第 2 页也列入引用,但关键条款其实集中在第 1、3、4 页。

DeepSeek applying the controlling terms from a contract amendment

Test 9:多文件联合推理 — 10/10

第九个任务测试多文件协同:

  • 一个 CSV 存放库存数据
  • 一个 TXT 文件写明补货公式
  • 一个 PDF 列出在途到货

模型需要根据三份文件,计算三个 SKU 的到货后可用库存与补货数量。

DeepSeek 成功:

  • 融合三种不同格式的内容
  • 正确处理某个 SKU 在途数量为 0 的情况
  • 给出精确结果:A-17 需补 3 件,B-04 无需补货,C-91 需补 5 件

Test 10:密码保护 PDF — 5/5

第十个任务不考察「破解能力」,而是「安全失败能力」。加密 PDF 中藏有一段验证短语,正确行为是:

  • 不声称自己读到了受保护内容
  • 不生成任何基于文件内容的总结

DeepSeek 的界面显示「No text extracted」,并禁用发送按钮;当输入提示词时,会提示「Remove failed files to submit」。由于请求根本没有送达模型,自然也不存在虚构的验证短语或摘要。这种「老老实实读不了就说读不了」的行为,在合规场景里反而是加分项。

表现稳定性与模式选择

重复测试:一致性如何?

我们把 3 个风险较高的任务在新对话中重复执行,用来观察结果是否稳定。三次复测中,所有关键字段的结果都与首次测试一致,一致性达到 100%。

这组样本规模不大,只能算是「健康信号」,远谈不上对所有文档的稳定性背书。我也不太确定这个一致性在更复杂的真实合同里是否还能维持,但至少说明:在受控环境下,DeepSeek 的波动不算夸张。

模式与设置:如何用出 89/100 的水平

有用户反馈:同一个 PDF,在不同模式、不同设置下,体验差异比「换一个大模型」还大。

推荐设置:Instant / Vision 怎么选?

  • Instant 适合:可搜索文本、表格、跨文件文字推理
  • Vision 适合:图表、截图、扫描页面中高度依赖视觉布局的内容
  • 关闭搜索:凡是答案必须完全来自上传文件的任务,都建议关掉搜索,避免外部信息「掺沙子」
  • 请求结构化输出:例如 JSON 字段,能让漏项、算错、引用错页一眼可见
  • 要求精确页码或文件名:再人工抽查几条,能快速筛出「看起来很对但证据不对」的回答
  • 确认发送按钮已激活:附件卡片出现不代表解析完成,按钮灰色时不要急着下结论
  • 不要想当然认为文件已被解析:界面若提示提取失败,就当这次上传没成功

操作步骤示例:如何上传并分析文件

  1. 打开一个新的 DeepSeek Chat 对话,先选好你要测试的模式(Instant 或 Vision)。
  2. 如果答案必须完全基于文件内容,就先关掉搜索功能。
  3. 点击附件按钮,选择文件,等待解析完成。
  4. 如果发送按钮一直不可用,或文件显示「No text extracted」,删除该文件,检查格式、加密状态或是否有文本层。
  5. 在提示词中明确要求结构化字段、必要的计算和精确证据页,然后把回答和原文件逐项对照。

文件类型、接口与隐私边界

支持格式与上传限制:别只看「上下文长度」

在 2026 年 7 月 24 日这次测试中,网页版 DeepSeek Chat 成功处理了 PDF、CSV 和 TXT 文件。这只是一次时点观察,不是长期承诺。

DeepSeek 公共帮助中心给出的失败示例包括:

  • 不支持的图片格式
  • 无法提取文本的图片
  • 超过最大限制的文件

但并没有公开一张精确的「大小 + 格式矩阵」。官方更新日志里提到过对文件上传和网页总结的优化,却没有把这些细节写成硬性指标。

有一个常见误区:把 DeepSeek V4 宣传的上下文窗口大小,直接当成 PDF 上传上限。实际上:

  • 上下文容量
  • 文件体积
  • 解析器行为
  • 以及最终送入模型的文本量

是四套不同的约束。更稳妥的做法,是在正式上生产前,用代表性文档在真实界面里跑一遍,看是否能完整解析。

Chat 与 API:两个完全不同的文件故事

这次基准测试用的是消费者版 Chat 界面,它自带一层文件处理能力。而公开的 chat-completions API 文档,目前只把消息内容描述为文本。

DeepSeek 的 Anthropic 兼容文档中,也明确标注:图片、文档和容器上传块暂不支持。换句话说:

  • 浏览器里能拖 PDF 进去,不代表 API 也能直接吃 PDF
  • 如果你在做 API 工作流,仍然需要在本地完成文本抽取、表格解析或 OCR,再把结果作为纯文本发给模型
  • 不要把「网页上传行为」当成「官方 API 能力」对外宣传

隐私与合规:哪些文件不该上传?

DeepSeek 的隐私政策把上传的文件、照片和聊天内容都视为用户输入,并提醒用户不要提交敏感个人数据。政策说明:

  • 输入可能被用于提供和改进服务
  • 用户可以选择是否参与训练改进
  • 数据会在中国境内存储和处理

在当前数据安全环境下,更稳妥的做法包括:

  • 测试阶段尽量使用合成或充分匿名化的文件
  • 未经批准的数据治理流程,不要上传客户合同、病历、身份证件、私人财务记录或商业机密
  • 使用前先看一眼最新隐私政策和账号设置
  • 对所有高影响力回答(尤其是法律、财务、合规相关),务必回到原文档逐条核对
  • 只在本地移除文件密码,且前提是你本来就有权访问该文件;不要在聊天提示词中直接写出密码

结论:DeepSeek 的 PDF 能力,能信到什么程度?

在这组小规模、可控的合成基准中,只要提示词要求结构化输出,并把文档路由到合适的模式,DeepSeek Chat 在文件分析上表现相当可靠。Instant 在文本提取、数值计算、OCR、长文档检索、修订条款和多文件推理上都交出了不错的成绩,两次扣分都来自「证据页多报了一页」,而不是数值错误。

真正的警示来自那张纯图片柱状图:Instant 1/10、Vision 10/10,足以说明一句「DeepSeek 会读 PDF」太粗糙。更实用的说法是:

  • 文本为主的 PDF,用 Instant
  • 图表、截图为主的 PDF,用 Vision
  • 所有关键结论,都回到原文档再看一眼

如果把失败的 Instant 图表结果替换为后续 Vision 诊断,产品总分可以从 89/100 提升到 98/100。但这并不是事先声明的路由基准,也没有独立复测,所以 89/100 仍然是主要结果。无论是哪一个分数,都不足以支撑「完全去掉人工复核」——尤其是在法律、财务、医疗、合规或强时效决策里。

这个判断方法在多次项目里都被证明挺好用:先看任务是不是高度依赖视觉,再决定用哪个模式,然后强制自己做一次抽查。你可以把这套流程收起来,当成以后选模型、选模式时的一个小清单。如果你正好在为团队搭建 AI 文档工作流,这篇实测往往比问身边人「好不好用」更有参考价值。

常见问题

Q:DeepSeek 适合直接用来审合同 PDF 吗?

A:可以用来做合同条款提取和初步对比,但不建议把它当成唯一审阅人。原因在于:本次测试中,DeepSeek 在修订条款和长文档检索上表现不错,但也出现了证据页引用过宽、图表模式选错导致信息缺失等情况。实际合同往往更复杂,涉及交叉引用、附录和多轮修订。更稳妥的做法是:用 DeepSeek 先抽取关键条款、金额、日期和变更点,再由专业人士对照原文逐条确认,尤其是解约、违约责任和费用条款。

Q:Instant 和 Vision 模式到底怎么选,才不踩坑?

A:简单说:文字为主选 Instant,视觉元素为主选 Vision。原因是:在本次测试中,Instant 在可搜索文本、表格和扫描小票 OCR 上表现稳定,但在纯图片柱状图上完全读不出数值;同一文件换到 Vision 后则满分通过。建议你在新项目开始前,先挑 2–3 个典型文件,分别用 Instant 和 Vision 跑一遍,看哪种模式在你场景下更稳,然后把这个选择写进团队的操作规范里,避免每个人随意切换。

Q:多文件一起上传时,DeepSeek 会不会搞混不同来源?

A:在这次三文件联合推理测试中,DeepSeek 能正确区分 CSV、TXT 和 PDF 的角色,并按公式合并信息,没有出现「张冠李戴」。不过,多文件场景的风险在于:一旦提示词不够清晰,模型可能会默认某个文件为主来源,忽略其他文件。建议在提示词中明确写出每个文件的用途(比如「inventory.csv 只用于库存数据」「rules.txt 只用于计算规则」),并在输出中要求标注每个结论对应的来源文件名,方便你事后抽查。

Q:加密 PDF 上传不上去,是不是说明 DeepSeek 很弱?

A:恰恰相反,这在安全合规角度反而是好事。本次测试中,加密 PDF 被标记为「No text extracted」,发送按钮被禁用,模型没有机会接触到文件内容,也没有编造任何摘要。原因在于:浏览器端的文件处理层在模型之前就拦截了加密文件,这符合「不绕过用户本地安全控制」的原则。对你来说,更重要的建议是:不要指望模型帮你「破解」受保护文件,而是先在本地、在合规前提下解密,再决定是否上传。

Q:我怎么判断一个 PDF 是否真的被解析成功?

A:可以从界面和输出两个层面来判断。界面上,如果附件卡片显示提取失败、发送按钮一直是灰色,基本可以认定解析没成功;输出上,如果模型对本应存在的关键信息频繁回答「未知」「未找到」,也要警惕解析问题。更可靠的做法是:在提示词中要求模型返回精确页码和原文片段,然后随机抽几条到 PDF 里核对。如果发现页码对不上、原文找不到,就要考虑重新上传、换模式,或者在本地先做 OCR 再发给模型。

官方文档与政策链接可在 DeepSeek 帮助中心、更新日志、V4 公告、模型与定价说明、chat-completions API 参考、Anthropic 兼容指南以及隐私政策、使用条款中查阅。功能、接口与政策都可能随时间调整,使用前建议再核对一次最新信息。