
Gemini 多模态指南:分析图片、文档与混合材料
学习如何组织图片和文档输入、指定分析目标,并核验 Gemini 的多模态结果。
多模态任务的难点不是上传文件,而是让 Gemini 知道应该观察什么、不同材料之间是什么关系,以及结果需要达到怎样的精度。
先整理输入材料
提交图片或文档前,先进行简单整理:
- 删除与任务无关的页面和截图;
- 确保文字方向正确、分辨率足够;
- 为多个文件使用清楚的文件名;
- 标明材料的顺序和用途;
- 遮盖身份证号、联系方式、密钥等敏感信息。
清晰的输入能减少识别错误,也能降低模型把无关内容当成证据的概率。
指定观察对象与分析动作
“分析这张图”范围太大。更好的写法应该包含对象、动作和结果格式:
材料:一张产品数据仪表盘截图。
任务:
1. 读取图中 4 个核心指标及其环比变化;
2. 找出变化幅度最大的指标;
3. 只根据图中可见数据解释,不推测业务原因;
4. 无法辨认的数字标记为“无法确认”。
输出:先给出四列表格,再用三句话总结。
这类提示词会明确告诉模型:识别、比较和解释是三个不同阶段。
多个文件要声明关系
同时提供图片、PDF 和表格时,说明每份材料扮演什么角色。例如:
| 文件 | 角色 | 使用方式 |
|---|---|---|
brief.pdf | 需求基准 | 判断方案是否满足要求 |
design.png | 待评审对象 | 检查布局和可读性 |
metrics.csv | 数据证据 | 核对设计中展示的数字 |
如果不同文件互相矛盾,还应指定优先级,或者要求 Gemini 先列出冲突,不要自行选择。
文档分析采用分阶段流程
长文档适合拆成三个阶段:
- 建立结构:列出章节、表格和关键主题;
- 定向提取:只抽取与当前问题有关的段落和数据;
- 综合回答:根据已提取证据形成结论并标注出处。
直接要求总结整份长文档,容易得到平均但缺乏重点的答案。先确定结构,再定向检索,结果通常更可核验。
核验视觉识别结果
图片中的小字、密集表格、遮挡和相近颜色都可能造成误读。可以采用以下方法:
- 要求保留原始文字,不要在识别阶段改写;
- 让模型标记低置信度或无法确认的位置;
- 对关键数字回到原图逐项检查;
- 将识别结果输出为表格,便于与原图对照;
- 对同一结论要求指出来自哪个文件、页面或区域。
多模态模型可以加速阅读,但不应让原始材料从验证流程中消失。
一个完整的混合材料模板
我将提供三份材料:产品说明、界面截图和测试记录。
请按以下顺序处理:
1. 分别说明每份材料包含什么;
2. 根据产品说明列出验收条件;
3. 使用截图和测试记录逐项判断是否满足;
4. 证据不足时写“待确认”,不要补充假设;
5. 输出“条件 / 结论 / 证据位置 / 后续动作”四列表格。
这个模板适合设计评审、产品验收和研究资料整理。更换材料角色和验收条件后,也可以用于许多专业场景。
使用前检查
- 文件是否清晰、方向正确且与任务相关?
- 是否说明了每份材料的角色和优先级?
- 是否要求标记无法识别或证据不足的内容?
- 输出能否方便地与原始材料逐项核对?
- 是否已经移除不必要的敏感信息?
多模态能力最适合承担“阅读、定位和组织”的工作。最终结论越重要,越应该保留原始材料和人工复核。