直连通道
官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入 | 输出 | 缓存命中 |
|---|---|---|
| 0.44/M | 1.32/M | 0.01/M |
使用实验性 deepseek-v4-flash-vision-exp 模型执行混合图像和文本任务,例如屏幕截图检查、文档提取、图表分析和视觉代理。
同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。
价格单位:$ / 1M tokensprovider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。官方直连链路,适合需要原生体验与完整上下文的请求。
| 输入 | 输出 | 缓存命中 |
|---|---|---|
| 0.44/M | 1.32/M | 0.01/M |
DeepSeek V4 Flash Vision Exp 是 DeepSeek 于 2026 年 8 月 21 日上线的实验性多模态模型,在 V4 Flash 的基础上加入了图像理解能力。文本能力——包括智能体、推理和世界知识——与 V4 Flash 完全持平,也就是说加视觉不牺牲原有文本表现。
最值得关注的是它在多模态智能体评测上的跃升:整体表现逼近 Claude Opus 4.8,11 项基准中有 3 项反超。ApexBench(Pass@1)从纯文本 V4 Flash 的 26.2 跳到 36.5,Terminal Bench 2.1 达到 83.9(V4 Flash 为 82.7,Opus 4.8 为 85.0)——而它依然是那个 13B 激活参数的高效稀疏 MoE。
海鲸AI 通过 OpenAI 兼容接口提供 DeepSeek V4 Flash Vision Exp,支持图像输入、工具调用与流式输出。
获取 API 密钥 · 模型 ID:
deepseek-v4-flash-vision-exp
这是本次升级的核心。加入视觉后,模型可以在智能体流程中直接"看"截图、界面和图表来决定下一步动作,多模态智能体基准上的表现已经接近顶级闭源模型。
支持图像描述、截图文字提取和图表分析三类核心视觉任务,覆盖日常多模态需求的主要场景。
每张图像最多按 384 token 计费,与分辨率无关;还可以用 detail 字段进一步降低对细节要求不高的图像的 token 消耗。图像按 V4 Flash 档位计价。
detail 字段按需降低消耗支持 JPEG、PNG、GIF、WebP 四种格式,按文件实际内容识别格式而非扩展名。可通过 Base64 内嵌、公网 URL(最大 32 MiB)或免费的 Files API(最大 64 MiB)传入——Files API 上传一次即可跨请求用 file_id 复用,省去重复传输。
| 场景 | 说明 |
|---|---|
| 多模态智能体 | 看截图操作界面、读图表做决策的自动化流程 |
| 文档数字化 | 扫描件、截图的批量文字提取与结构化 |
| 图表分析 | 报表、示意图、技术图纸的解读 |
| 图文混排长文档 | 100 万 token 窗口内的多模态文档理解 |
| 大批量图像管线 | 单请求 600 张图 + 单图成本封顶,适合规模化处理 |
| 低成本视觉原型 | 用 Flash 档位价格验证多模态产品思路 |
| 能力 | V4 Flash Vision Exp | V4 Flash |
|---|---|---|
| 模型 ID | deepseek-v4-flash-vision-exp |
deepseek-v4-flash |
| 输入模态 | 文本 + 图像 | 仅文本 |
| 文本能力 | 与 Flash 持平 | 基准 |
| ApexBench(Pass@1) | 36.5 | 26.2 |
| Terminal Bench 2.1 | 83.9 | 82.7 |
| 总参数 / 激活参数 | 2840 亿 / 13B | 2840 亿 / 13B |
| 上下文窗口 | 100 万 token | 100 万 token |
| 最大输出 | 384K token | 384K token |
| 状态 | 实验版(Exp) | 正式版 |
具体计费以页面上方的实时价格卡片为准。
它和 V4 Flash 是什么关系? 它是 V4 Flash 的多模态实验版:同一个 284B/13B 稀疏 MoE 基座,文本能力持平,额外增加了图像输入。可以理解为"会看图的 Flash"。
多模态表现到底怎么样? 在多模态智能体基准上整体逼近 Claude Opus 4.8,11 项中有 3 项反超。代表性数据:ApexBench(Pass@1)36.5、Terminal Bench 2.1 83.9。
图像怎么计费?
每张图像最多折算 384 token,与分辨率无关,按 V4 Flash 档位计价。对细节要求不高的图像可以用 detail 字段进一步省 token。
图像输入有什么限制? 支持 JPEG、PNG、GIF、WebP;单请求最多 600 张;图像最长边 8192 像素(超过 15 张时降为 4096);URL 方式单文件最大 32 MiB,Files API 最大 64 MiB。图像在处理前会归一化到约 800×800 像素。
"Exp" 后缀意味着什么? 它是实验性版本,DeepSeek 用它验证多模态方向,接口和行为可能随正式版发布而调整。生产环境建议做好模型 ID 可配置,方便未来平滑切换到正式版。
上下文和输出上限? 100 万 token 上下文,最大输出 384K token,与 V4 Flash 相同。
deepseek-v4-flash-vision-exphttps://api.atalk-ai.com/v2/"provider": { "channel": "direct" }海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。
关于 provider 参数(可选,海鲸AI 扩展字段):同一模型通常有多条服务通道,价格与稳定性略有差异。在请求体中加入 provider 字段即可指定通道;不传该字段时由系统自动选择默认通道,不影响正常调用。
provider并非 OpenAI 官方协议中的字段,而是海鲸AI 的扩展参数,仅在本平台生效。OpenAI SDK 允许透传此类自定义字段,用法见下方示例。
| 取值 | 通道 | 适用场景 |
|---|---|---|
direct | 直连通道 | 官方直连链路,追求原生体验与完整上下文 |
stable | 优选通道 | 兼顾可用性、速度,适合日常生产调用 |
economical | 特惠通道 | 成本优先,适合批量处理与价格敏感业务 |
具体通道与对应价格以上方「定价」为准(各模型开通的通道可能不同)。补充说明:
"provider": { "channel": "direct" }。extra_body 传入;Node.js 直接写在请求对象中即可透传,TypeScript 项目加一行 // @ts-expect-error 跳过类型检查。curl https://api.atalk-ai.com/v2/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer <API_KEY>" \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"}
],
"provider": { "channel": "direct" },
"stream": true
}'
# provider 为可选字段,删除该行即使用默认通道from openai import OpenAI
client = OpenAI(
base_url="https://api.atalk-ai.com/v2",
api_key="<API_KEY>",
)
stream = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{"role": "system", "content": "你是一个有帮助的助手。"},
{"role": "user", "content": "你好!"},
],
stream=True,
# 可选:指定服务通道,不传则使用默认通道
extra_body={"provider": {"channel": "direct"}},
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)import OpenAI from 'openai'
const client = new OpenAI({
baseURL: 'https://api.atalk-ai.com/v2',
apiKey: '<API_KEY>',
})
const stream = await client.chat.completions.create({
model: 'deepseek-v4-flash-vision-exp',
messages: [
{ role: 'system', content: '你是一个有帮助的助手。' },
{ role: 'user', content: '你好!' },
],
stream: true,
// 可选:指定服务通道,不传则使用默认通道
// @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
provider: { channel: 'direct' },
})
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}