多模态识图 · 意图识别评测 · 2026.05

DeepSeek 识图模型
意图识别评测报告

面向含图多模态场景,系统评估 DeepSeek 识图模型在意图识别准确性与任务完成质量上的表现,并与千问、豆包横向对标,定位能力短板与优化优先级。

156 条含图 Query 9 个一级意图 / 26 个二级意图 0–3 分制 DeepSeek · 千问 · 豆包
CONTENTS

目录

01

评测背景

一、评测背景

随着多模态大模型的发展,识图问答(VQA)已成为 C 端 AI 助手的核心能力之一。用户频繁上传图片、截图、文档等视觉内容并围绕图片提出诉求,模型不仅要"看懂图",更要准确识别用户意图,完成问答、解释、翻译、搜索、创作、办公处理等具体任务。

本次评测以 DeepSeek 识图模型(Deepseek V4 内测版)为评估主体,对标千问与豆包,系统性评估其在含图多模态场景下的意图识别准确性任务完成质量,定位能力短板并给出优化优先级。

02

评测概览

二、评测概览

本次评测共使用 156 组含图 VQA 测试样本,覆盖 9 个一级意图26 个二级意图,并按难度 1(基础任务)与难度 2(复杂 / 多约束任务)进行难度标注。

评测维度涵盖:意图识别准确性、图片理解准确性、任务完成质量、回答可用性。每个模型在 Android 与 iOS 双平台分别测评。

样本设计:26 个二级意图 × 6 条含图 query / 类 = 156 条(其中拍照解题含 2 个二级意图,共 12 条)。

模型版本平台
DeepSeek 内测版Deepseek V4Android
DeepSeek 内测版Deepseek V4iOS
千问Qwen3Android
千问Qwen3iOS
豆包Seed 3.0Android
豆包Seed 3.0iOS
03

评分标准

三、评分标准(0–3 分制)

分值等级说明
3 分优秀完全满足用户需求。意图识别正确,图片理解准确,任务完成质量高,回答可直接使用。
2 分可用基本满足需求但存在一定缺陷。如回答部分缺失、视角不全、信息单薄、视觉体验一般等。
1 分不可用存在严重缺陷,用户无法直接使用。如关键信息错误、OCR 提取严重错误、回答偏离用户意图等。
0 分完全不可用完全未满足用户需求。如拒绝回答、答非所问、意图完全错误、图片理解完全失败等。

评测维度

  • 意图识别准确性:一级意图 + 二级意图是否识别正确
  • 图片理解准确性:是否正确识别图片中的关键信息
  • 任务完成质量:是否按用户要求完成任务(格式、结构、完整性)
  • 回答可用性:用户是否可直接使用,无需二次修正
04

整体表现

四、整体表现 · 4.1 模型总分对比

排名模型有效样本平均分3 分占比0–1 分占比2 分占比
1豆包 Android1562.4571.6%20.0%8.4%
2豆包 iOS1562.4370.3%18.7%11.0%
3千问 iOS1562.1559.4%31.6%9.0%
4千问 Android1562.1356.8%31.1%12.2%
5DeepSeek 内测 Android1561.9349.7%39.9%10.5%
6DeepSeek 内测 iOS1561.7745.2%43.9%11.0%

4.2 分档分布(条数,合计 156)

模型0 分1 分2 分3 分合计
DeepSeek 内测 Android27351678156
DeepSeek 内测 iOS39291771156
千问 Android21271989156
千问 iOS21281493156
豆包 Android112013112156
豆包 iOS141517110156

4.3 核心发现

  • DeepSeek 整体偏弱:Android 1.93 / iOS 1.77,两平台均低于 2 分,3 分占比仅 45%–50%,落后千问约 0.2–0.4 分、落后豆包约 0.5 分。
  • 0–1 分占比偏高:iOS 高达 43.9%,意味着近半数样本不可用,主要集中在资源搜索与创作 / 办公生成类任务。
  • iOS 弱于 Android:iOS 较 Android 低 0.16 分,0 分样本由 25 增至 37,平台一致性有待提升。
05

一级意图维度分析

五、一级意图维度 · DeepSeek 表现与对标

一级意图样本 DeepSeek ADeepSeek iOS 千问(最优)豆包(最优) DS–豆包差距评价
知识问答182.782.892.892.94+0.05基本持平
闲聊122.332.752.832.92+0.17略落后
办公用具361.541.391.692.50+0.96明显落后
资源搜索180.890.892.282.78+1.89严重落后
翻译122.922.922.833.00+0.08基本持平
拍照解题122.732.552.913.00+0.27略落后
拍照帮帮122.672.002.332.42−0.25DeepSeek 领先
内容创作241.501.082.172.33+0.83明显落后
其他121.000.921.251.00+0.00基本持平

关键发现

  • 语言 / 推理类是强项:翻译(2.92)、知识问答(2.89)、拍照解题(2.73)表现稳健,意图识别准确,与豆包差距均在 0.3 分内。
  • 拍照帮帮反超:DeepSeek Android 2.67,为三模型中该类别最高,优于豆包(2.42)与千问(2.33)。
  • 资源搜索是最大短板:仅 0.89 分,落后豆包 1.89 分、落后千问 1.39 分 → 模型无法返回真实图片 / 视频资源,仅给出文字描述或占位。
  • 创作与办公生成类薄弱:内容创作 1.08–1.50、办公用具 1.39–1.54 → 不支持图片 / 视频生成与 PPT / Word 文档生成,属功能性缺失。
06

难度维度分析

六、难度维度分析(基于 73 条难度标注样本,整体 156 条的子集)

难度等级样本DeepSeek ADeepSeek iOS千问 A千问 iOS豆包 A豆包 iOS
难度 1(基础)401.921.702.442.482.502.60
难度 2(复杂)331.891.642.032.002.422.52
  • DeepSeek 衰减平缓但基线偏低:Android 1.92→1.89(降 0.03)、iOS 1.70→1.64(降 0.06),难度 1 与难度 2 得分接近——说明其差距并非来自复杂指令,而是基础能力缺失
  • 与千问形成对照:千问随难度上升明显衰减(Android 2.44→2.03,降 0.40),DeepSeek 则是"高难低难都低",问题性质不同。
  • 豆包稳定性最优:难度 2 仍维持 2.42–2.52,复杂指令理解与执行最稳健。

注:难度分级覆盖 73 条已标注样本(难度 1:40 条,难度 2:33 条),与整体 156 条样本量不同,仅用于难度趋势对比。

07

短板归因与典型 Bad Case

七、DeepSeek 短板归因与典型案例

7.1 短板归因

问题类型主要表现影响类别性质
资源返回缺失无法返回真实图片 / 视频资源,仅给文字描述或链接占位资源搜索功能缺失
媒体生成缺失不支持图片 / 视频生成,创作类需求直接落空内容创作功能缺失
文档生成缺失不支持 PPT / Word 生成,办公生成类多为 0–1 分办公用具功能缺失
识别准确性扫码、小字 / 手写体、复杂版面 OCR 识别不足办公用具 / 其他能力不足
平台一致性iOS 整体弱于 Android,创作与拍照帮帮差距明显内容创作 / 拍照帮帮工程问题

7.2 典型 Bad Case

资源搜索 · 0.89

Case 1 资源搜索-视频:无法溯源

用户要求查找并播放对应视频,DeepSeek 仅返回文字描述,无法给出真实视频链接或播放器,回答停留在文字层面,无法满足实际观看需求。豆包可直接给出可用资源。

内容创作 · 1.08(iOS)

Case 2 内容创作-图片 / 视频生成

用户要求基于图片进行二次创作或生成新图 / 短视频,DeepSeek 不支持媒体生成,转为文字回应或拒答,创作类诉求直接落空,iOS 表现尤为薄弱。

办公用具 · 1.39–1.54

Case 3 办公用具-生成 PPT / Word

用户要求依据图片内容生成 PPT 或 Word 文档,DeepSeek 不具备文档生成能力,仅输出纯文本大纲,无法交付可用文件,办公生成类普遍 0–1 分。

办公用具-扫码

Case 4 办公用具-扫二维码 / 条形码

对二维码、条形码等基础识图场景,DeepSeek 识别稳定性不足,难以准确还原码内信息,影响办公用具整体得分。

08

优化建议

八、优化建议 · 优先级排序

优先级改进方向关联意图预期收益
P0 紧急补齐资源检索"返真"能力资源搜索-图片 / 视频从 0.89 提升至 2.3+,单类别消除大量 0 分 case
P0 紧急支持图片 / 视频生成内容创作-图片 / 视频创作补齐创作类核心能力,平均分提升约 0.10–0.15
P1 重要支持 PPT / Word 文档生成办公用具-生成 ppt / word办公生成类由 0–1 分转为可用,提升约 0.08–0.12
P1 重要iOS 能力对齐 Android内容创作 / 拍照帮帮弥补 iOS 与 Android 的 0.16 分整体差距
P2 优化增强扫码与 OCR 识别(模糊 / 手写 / 小字)办公用具 / 全类别降低识别准确性导致的 1–2 分 case
P2 优化提升闲聊人设与多约束指令遵循闲聊 / 难度 2 场景提升复杂任务的任务完成度与稳定性

具体优化方向

  • 资源检索返真:接入真实图 / 视频检索与播放能力,确保返回可点击、可观看的资源而非文字占位——这是当前最致命的短板。
  • 媒体生成:建设图片 / 视频生成能力,覆盖以图生图、图片二次创作、短视频生成等高频创作场景。
  • 文档生成:支持 PPT / Word 生成,优化模板与排版,确保结构完整、内容不遗漏。
  • 识别基础:针对二维码 / 条形码、模糊文字、手写体、小字体等难点场景做专项识别优化。
  • 平台一致性:排查 iOS 与 Android 能力差异,统一两端的功能开关与执行链路。
09

结论

九、结论

基于 156 组测试样本的综合评估,三个模型表现排名如下(DeepSeek 为本次评估主体):

#1

豆包

Android 2.45 / iOS 2.43
  • 表现最优,3 分占比超 70%
  • 几乎所有意图类别均领先
  • 扫码、文档生成、资源搜索优势显著
  • 难度迁移稳定性最好
#2

千问

Android 2.13 / iOS 2.15
  • 表现居中,与豆包差距约 0.3 分
  • 知识问答 / 翻译 / 解题接近豆包
  • 短板:扫码、PPT 生成、作业帮帮
  • 难度上升时衰减较明显
#3 · 主体

DeepSeek 内测版

Android 1.93 / iOS 1.77
  • 语言 / 推理类稳健:翻译、知识问答、解题
  • 拍照帮帮 Android 反超,达三模型最高
  • 短板:资源搜索(0.89)、创作 / 办公生成
  • 核心问题是能力缺失,而非意图识别错误

核心结论

DeepSeek 识图模型在意图识别与语言 / 推理类任务上表现稳健,意图识别本身准确;其核心问题集中在能力性缺失——无法返回真实图 / 视频资源、不支持图片 / 视频生成与文档生成,导致资源搜索、内容创作、办公用具三类得分被显著拉低。补齐"资源检索返真 + 媒体生成"两个 P0 能力后,DeepSeek 平均分预计可从约 1.85 提升至 2.2–2.35,接近千问水平。

下一阶段建议

  • 补充评测样本:扫码、资源搜索等场景样本数量偏少,建议补充更多类型样本提升结论稳健性。
  • 统一难度标注:将难度标注覆盖全部 156 条样本,使难度维度与整体口径一致。
  • 增加竞品维度:下一阶段可纳入 GPT-4o、Gemini 等国际竞品做横向对比。
  • 满意度交叉验证:将评测分与真实用户行为数据(点赞 / 踩、回答时长等)交叉验证。