面向含图多模态场景,系统评估 DeepSeek 识图模型在意图识别准确性与任务完成质量上的表现,并与千问、豆包横向对标,定位能力短板与优化优先级。
一、评测背景
随着多模态大模型的发展,识图问答(VQA)已成为 C 端 AI 助手的核心能力之一。用户频繁上传图片、截图、文档等视觉内容并围绕图片提出诉求,模型不仅要"看懂图",更要准确识别用户意图,完成问答、解释、翻译、搜索、创作、办公处理等具体任务。
本次评测以 DeepSeek 识图模型(Deepseek V4 内测版)为评估主体,对标千问与豆包,系统性评估其在含图多模态场景下的意图识别准确性与任务完成质量,定位能力短板并给出优化优先级。
二、评测概览
本次评测共使用 156 组含图 VQA 测试样本,覆盖 9 个一级意图与 26 个二级意图,并按难度 1(基础任务)与难度 2(复杂 / 多约束任务)进行难度标注。
评测维度涵盖:意图识别准确性、图片理解准确性、任务完成质量、回答可用性。每个模型在 Android 与 iOS 双平台分别测评。
样本设计:26 个二级意图 × 6 条含图 query / 类 = 156 条(其中拍照解题含 2 个二级意图,共 12 条)。
| 模型 | 版本 | 平台 |
|---|---|---|
| DeepSeek 内测版 | Deepseek V4 | Android |
| DeepSeek 内测版 | Deepseek V4 | iOS |
| 千问 | Qwen3 | Android |
| 千问 | Qwen3 | iOS |
| 豆包 | Seed 3.0 | Android |
| 豆包 | Seed 3.0 | iOS |
三、评分标准(0–3 分制)
| 分值 | 等级 | 说明 |
|---|---|---|
| 3 分 | 优秀 | 完全满足用户需求。意图识别正确,图片理解准确,任务完成质量高,回答可直接使用。 |
| 2 分 | 可用 | 基本满足需求但存在一定缺陷。如回答部分缺失、视角不全、信息单薄、视觉体验一般等。 |
| 1 分 | 不可用 | 存在严重缺陷,用户无法直接使用。如关键信息错误、OCR 提取严重错误、回答偏离用户意图等。 |
| 0 分 | 完全不可用 | 完全未满足用户需求。如拒绝回答、答非所问、意图完全错误、图片理解完全失败等。 |
评测维度
四、整体表现 · 4.1 模型总分对比
| 排名 | 模型 | 有效样本 | 平均分 | 3 分占比 | 0–1 分占比 | 2 分占比 |
|---|---|---|---|---|---|---|
| 1 | 豆包 Android | 156 | 2.45 | 71.6% | 20.0% | 8.4% |
| 2 | 豆包 iOS | 156 | 2.43 | 70.3% | 18.7% | 11.0% |
| 3 | 千问 iOS | 156 | 2.15 | 59.4% | 31.6% | 9.0% |
| 4 | 千问 Android | 156 | 2.13 | 56.8% | 31.1% | 12.2% |
| 5 | DeepSeek 内测 Android | 156 | 1.93 | 49.7% | 39.9% | 10.5% |
| 6 | DeepSeek 内测 iOS | 156 | 1.77 | 45.2% | 43.9% | 11.0% |
4.2 分档分布(条数,合计 156)
| 模型 | 0 分 | 1 分 | 2 分 | 3 分 | 合计 |
|---|---|---|---|---|---|
| DeepSeek 内测 Android | 27 | 35 | 16 | 78 | 156 |
| DeepSeek 内测 iOS | 39 | 29 | 17 | 71 | 156 |
| 千问 Android | 21 | 27 | 19 | 89 | 156 |
| 千问 iOS | 21 | 28 | 14 | 93 | 156 |
| 豆包 Android | 11 | 20 | 13 | 112 | 156 |
| 豆包 iOS | 14 | 15 | 17 | 110 | 156 |
4.3 核心发现
五、一级意图维度 · DeepSeek 表现与对标
| 一级意图 | 样本 | DeepSeek A | DeepSeek iOS | 千问(最优) | 豆包(最优) | DS–豆包差距 | 评价 |
|---|---|---|---|---|---|---|---|
| 知识问答 | 18 | 2.78 | 2.89 | 2.89 | 2.94 | +0.05 | 基本持平 |
| 闲聊 | 12 | 2.33 | 2.75 | 2.83 | 2.92 | +0.17 | 略落后 |
| 办公用具 | 36 | 1.54 | 1.39 | 1.69 | 2.50 | +0.96 | 明显落后 |
| 资源搜索 | 18 | 0.89 | 0.89 | 2.28 | 2.78 | +1.89 | 严重落后 |
| 翻译 | 12 | 2.92 | 2.92 | 2.83 | 3.00 | +0.08 | 基本持平 |
| 拍照解题 | 12 | 2.73 | 2.55 | 2.91 | 3.00 | +0.27 | 略落后 |
| 拍照帮帮 | 12 | 2.67 | 2.00 | 2.33 | 2.42 | −0.25 | DeepSeek 领先 |
| 内容创作 | 24 | 1.50 | 1.08 | 2.17 | 2.33 | +0.83 | 明显落后 |
| 其他 | 12 | 1.00 | 0.92 | 1.25 | 1.00 | +0.00 | 基本持平 |
关键发现
六、难度维度分析(基于 73 条难度标注样本,整体 156 条的子集)
| 难度等级 | 样本 | DeepSeek A | DeepSeek iOS | 千问 A | 千问 iOS | 豆包 A | 豆包 iOS |
|---|---|---|---|---|---|---|---|
| 难度 1(基础) | 40 | 1.92 | 1.70 | 2.44 | 2.48 | 2.50 | 2.60 |
| 难度 2(复杂) | 33 | 1.89 | 1.64 | 2.03 | 2.00 | 2.42 | 2.52 |
注:难度分级覆盖 73 条已标注样本(难度 1:40 条,难度 2:33 条),与整体 156 条样本量不同,仅用于难度趋势对比。
七、DeepSeek 短板归因与典型案例
7.1 短板归因
| 问题类型 | 主要表现 | 影响类别 | 性质 |
|---|---|---|---|
| 资源返回缺失 | 无法返回真实图片 / 视频资源,仅给文字描述或链接占位 | 资源搜索 | 功能缺失 |
| 媒体生成缺失 | 不支持图片 / 视频生成,创作类需求直接落空 | 内容创作 | 功能缺失 |
| 文档生成缺失 | 不支持 PPT / Word 生成,办公生成类多为 0–1 分 | 办公用具 | 功能缺失 |
| 识别准确性 | 扫码、小字 / 手写体、复杂版面 OCR 识别不足 | 办公用具 / 其他 | 能力不足 |
| 平台一致性 | iOS 整体弱于 Android,创作与拍照帮帮差距明显 | 内容创作 / 拍照帮帮 | 工程问题 |
7.2 典型 Bad Case
用户要求查找并播放对应视频,DeepSeek 仅返回文字描述,无法给出真实视频链接或播放器,回答停留在文字层面,无法满足实际观看需求。豆包可直接给出可用资源。
用户要求基于图片进行二次创作或生成新图 / 短视频,DeepSeek 不支持媒体生成,转为文字回应或拒答,创作类诉求直接落空,iOS 表现尤为薄弱。
用户要求依据图片内容生成 PPT 或 Word 文档,DeepSeek 不具备文档生成能力,仅输出纯文本大纲,无法交付可用文件,办公生成类普遍 0–1 分。
对二维码、条形码等基础识图场景,DeepSeek 识别稳定性不足,难以准确还原码内信息,影响办公用具整体得分。
八、优化建议 · 优先级排序
| 优先级 | 改进方向 | 关联意图 | 预期收益 |
|---|---|---|---|
| P0 紧急 | 补齐资源检索"返真"能力 | 资源搜索-图片 / 视频 | 从 0.89 提升至 2.3+,单类别消除大量 0 分 case |
| P0 紧急 | 支持图片 / 视频生成 | 内容创作-图片 / 视频创作 | 补齐创作类核心能力,平均分提升约 0.10–0.15 |
| P1 重要 | 支持 PPT / Word 文档生成 | 办公用具-生成 ppt / word | 办公生成类由 0–1 分转为可用,提升约 0.08–0.12 |
| P1 重要 | iOS 能力对齐 Android | 内容创作 / 拍照帮帮 | 弥补 iOS 与 Android 的 0.16 分整体差距 |
| P2 优化 | 增强扫码与 OCR 识别(模糊 / 手写 / 小字) | 办公用具 / 全类别 | 降低识别准确性导致的 1–2 分 case |
| P2 优化 | 提升闲聊人设与多约束指令遵循 | 闲聊 / 难度 2 场景 | 提升复杂任务的任务完成度与稳定性 |
具体优化方向
九、结论
基于 156 组测试样本的综合评估,三个模型表现排名如下(DeepSeek 为本次评估主体):
DeepSeek 识图模型在意图识别与语言 / 推理类任务上表现稳健,意图识别本身准确;其核心问题集中在能力性缺失——无法返回真实图 / 视频资源、不支持图片 / 视频生成与文档生成,导致资源搜索、内容创作、办公用具三类得分被显著拉低。补齐"资源检索返真 + 媒体生成"两个 P0 能力后,DeepSeek 平均分预计可从约 1.85 提升至 2.2–2.35,接近千问水平。
下一阶段建议