教程目录Gemini 多模态指南:分析图片、文档与混合材料
带有网格、数据折线和标记点的研究图表
带有网格、数据折线和标记点的研究图表
进阶 14 分钟

Gemini 多模态指南:分析图片、文档与混合材料

学习如何组织图片和文档输入、指定分析目标,并核验 Gemini 的多模态结果。

多模态任务的难点不是上传文件,而是让 Gemini 知道应该观察什么、不同材料之间是什么关系,以及结果需要达到怎样的精度。

先整理输入材料

提交图片或文档前,先进行简单整理:

  • 删除与任务无关的页面和截图;
  • 确保文字方向正确、分辨率足够;
  • 为多个文件使用清楚的文件名;
  • 标明材料的顺序和用途;
  • 遮盖身份证号、联系方式、密钥等敏感信息。

清晰的输入能减少识别错误,也能降低模型把无关内容当成证据的概率。

指定观察对象与分析动作

“分析这张图”范围太大。更好的写法应该包含对象、动作和结果格式:

材料:一张产品数据仪表盘截图。

任务:
1. 读取图中 4 个核心指标及其环比变化;
2. 找出变化幅度最大的指标;
3. 只根据图中可见数据解释,不推测业务原因;
4. 无法辨认的数字标记为“无法确认”。

输出:先给出四列表格,再用三句话总结。

这类提示词会明确告诉模型:识别、比较和解释是三个不同阶段。

多个文件要声明关系

同时提供图片、PDF 和表格时,说明每份材料扮演什么角色。例如:

文件角色使用方式
brief.pdf需求基准判断方案是否满足要求
design.png待评审对象检查布局和可读性
metrics.csv数据证据核对设计中展示的数字

如果不同文件互相矛盾,还应指定优先级,或者要求 Gemini 先列出冲突,不要自行选择。

文档分析采用分阶段流程

长文档适合拆成三个阶段:

  1. 建立结构:列出章节、表格和关键主题;
  2. 定向提取:只抽取与当前问题有关的段落和数据;
  3. 综合回答:根据已提取证据形成结论并标注出处。

直接要求总结整份长文档,容易得到平均但缺乏重点的答案。先确定结构,再定向检索,结果通常更可核验。

核验视觉识别结果

图片中的小字、密集表格、遮挡和相近颜色都可能造成误读。可以采用以下方法:

  • 要求保留原始文字,不要在识别阶段改写;
  • 让模型标记低置信度或无法确认的位置;
  • 对关键数字回到原图逐项检查;
  • 将识别结果输出为表格,便于与原图对照;
  • 对同一结论要求指出来自哪个文件、页面或区域。

多模态模型可以加速阅读,但不应让原始材料从验证流程中消失。

一个完整的混合材料模板

我将提供三份材料:产品说明、界面截图和测试记录。

请按以下顺序处理:
1. 分别说明每份材料包含什么;
2. 根据产品说明列出验收条件;
3. 使用截图和测试记录逐项判断是否满足;
4. 证据不足时写“待确认”,不要补充假设;
5. 输出“条件 / 结论 / 证据位置 / 后续动作”四列表格。

这个模板适合设计评审、产品验收和研究资料整理。更换材料角色和验收条件后,也可以用于许多专业场景。

使用前检查

  • 文件是否清晰、方向正确且与任务相关?
  • 是否说明了每份材料的角色和优先级?
  • 是否要求标记无法识别或证据不足的内容?
  • 输出能否方便地与原始材料逐项核对?
  • 是否已经移除不必要的敏感信息?

多模态能力最适合承担“阅读、定位和组织”的工作。最终结论越重要,越应该保留原始材料和人工复核。