大数跨境

DeepSeek V4 Flash正式接棒,能力强得有点可怕!我把它接进了Codex,还装上了一双“眼睛”

DeepSeek V4 Flash正式接棒,能力强得有点可怕!我把它接进了Codex,还装上了一双“眼睛” 我的Ai笔记
2026-08-03
5
导读:DeepSeek V4 Flash接入Codex,还能识图,普通打工人也能直接用它处理工作。
点击蓝字,关注我们


这是我的第470篇Ai笔记,本篇2890、累计笔记8417532

彩蛋:文末给大家准备了《DeepSeek V4 Flash × Codex:普通打工人的30个AI工作流》,覆盖运营、行政、人事、销售、财务、客服等岗位,每个场景都配了可直接使用的任务指令,记得取!

引言.

DeepSeek V4 Flash最近正式接棒了。

7月24日,原来的deepseek-chat和deepseek-reasoner停止使用,7月31日,V4 Flash正式版发布,成为DeepSeek API的新主力模型

但是DeepSeek V4 Pro还没有正式上线时间,让我们一同期待一下。

不过这次,DeepSeek V4 Flash的实力,确实强得有点可怕了。

100万上下文、最高384K输出,支持思考模式、工具调用和代码补全;推理能力接近V4 Pro,在简单Agent任务中甚至能与Pro打得有来有回。

但最离谱的还是价格:未命中缓存时,每百万输入Token只要1元,输出只要2元。

这已经是在用白菜价,买一颗能处理长文档、调用工具、连续执行任务的Agent大脑了。

看到这里,我脑子里马上冒出了一个想法:能不能把DeepSeek V4 Flash直接塞进Codex?

于是,我在官网上找到了答案。

最后不但成功把DeepSeek接进了Codex,还顺手给原本看不懂图片的它,装上了一双“眼睛”。

思考.

为什么要把DeepSeek接进Codex?

因为大模型和Agent工具,正在逐渐变成两个可以自由组合的部分。

DeepSeek V4 Flash负责理解要求、分析资料、规划步骤和生成结果。

Codex负责读取文件、修改内容、调用终端、安装Skill,并持续完成多步骤任务

OpenAI对Codex的定位,本身也已经不再是一个简单的代码聊天框。它可以管理多个Agent、并行执行任务,还能通过Skill扩展不同的工作能力。Windows版也已经正式上线。

两者组合起来,相当于:Codex提供手脚,DeepSeek提供大脑,Skill继续增加新的能力。

如果再接入一个视觉模型,原本不支持图片输入的DeepSeek,也能处理截图、设计稿和扫描文件。

过去使用AI工具,只能接受平台配好的模型和功能。

现在,Agent外壳、底层模型、Skill和工具,都可以自己选择。

AI工具开始从一件固定成品,变成一套可以自由组装的工作台。

这才是这次折腾真正有意思的地方。

AI+.

下面直接把整个配置过程跑一遍。

01|安装并启动Codex

先安装Codex客户端。

Windows用户可以通过微软商店找到官方版本。安装时认准OpenAI发布者,避免下到名字相似的第三方软件。

安装完成后,至少正常启动一次。

因为Codex首次运行时,会在电脑中生成配置目录。后面接入DeepSeek,需要读取和修改其中的配置文件。

打开后如果出现登录提示,可以先关闭,继续进行下一步。

02|申请DeepSeek API Key

进入DeepSeek开放平台,在API Keys页面创建一个新的Key。

名称可以直接填写:Codex

创建完成后,立即复制并保存。

完整API Key通常只会显示一次,不要发到群聊、文章截图或公开代码中。

账户内还需要有少量API余额。

这套方案不用购买额外的模型订阅,后续按照DeepSeek API的实际Token消耗扣费。

DeepSeek API同时兼容OpenAI和Anthropic接口格式,这也是它能够接入多种Agent工具的基础。

03|一条命令接入Codex

接下来打开Windows PowerShell。使用下面这条配置命令:

irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex

运行后,根据提示选择DeepSeek V4 Flash,再粘贴刚刚申请的API Key。

脚本会自动备份原来的Codex配置,并写入DeepSeek模型信息。配置完成后,关闭并重新启动Codex。

进入对话后,可以直接问一句:你现在使用的是什么模型?

如果返回DeepSeek V4 Flash,说明接入已经完成。

到这里,Codex的执行环境已经保留下来,背后负责思考的模型则换成了DeepSeek。

04|再给它装上识图能力

但还有一个问题:DeepSeek V4 Flash本身不支持直接识图。

视频里使用了一个开源的Vision Skill,借助外部多模态模型读取图片。

在Codex中新建会话,输入:请阅读下面项目的README,帮我完成识图Skill的安装和配置。

再把项目地址发给它:https://github.com/asuojun/claude-vision-skill

接着按照提示,填入千问或其他视觉模型的API信息。

配置完成后,直接把图片拖进Codex即可。

图片先由视觉模型识别,再把结果交给DeepSeek继续分析。

就这样,原本看不懂图片的DeepSeek,被补上了一双眼睛。

祛魅与吐槽.

折腾完之后,这套组合确实比我预想中更实用。但该泼的冷水,还是得泼。

第一,它不是真正免费

不购买额外订阅,不代表完全没有费用。

DeepSeek需要消耗API余额,识图时调用的视觉模型,也有自己的免费额度或计费规则。

偶尔处理文档、图片和个人项目,成本通常不高。

如果一次读取大量文件,或者反复执行长任务,Token消耗依然需要关注。

第二,DeepSeek并没有获得原生视觉能力

图片先由另一个视觉模型识别,再把文字结果传给DeepSeek。

前面的识图结果一旦出错,后面的分析也会跟着跑偏。

普通截图、插画和设计稿基本够用。

遇到模糊小字、复杂表格和专业图纸,依然需要人工复核。

第三,敏感资料不能随便上传

使用识图Skill时,图片需要发送到配置的第三方模型接口。

公司内部系统截图、客户资料、财务数据、源代码和未公开文件,都不能闭眼上传。

正式用于工作前,需要先确认服务商的数据保存规则、接口权限和日志范围。

第四,一键脚本也不能闭眼执行

PowerShell的一键配置确实方便,但它会直接下载远程脚本并在本机运行。

在个人测试电脑上,可以按照视频方法尝试。

如果换成公司电脑或重要开发环境,最好先查看脚本内容,确认它修改了哪些配置,再决定是否执行。

省事归省事,安全检查不能省。

三句话.

最后,老规矩,用三句话总结今天的折腾:

DeepSeek V4 Flash拥有100万上下文、工具调用和接近Pro的Agent能力,再加上极低的API价格,确实很适合放进Agent里长期干活。

接入Codex之后,可以保留Codex读取文件、调用工具和执行任务的能力,再由DeepSeek负责分析与生成。

这套组合真正有价值的地方,不只在写代码,而是让普通人也能把文件、表格、图片和重复工作直接交给AI处理。

🎁彩蛋福利🎁

这次准备的是:《DeepSeek V4 Flash × Codex:普通打工人的30个AI工作流》

覆盖运营、行政、人事、销售、财务、客服和项目管理等岗位,每个场景都配有可直接使用的任务指令。

老规矩,点赞+在看,扫码回复关键词【V4工作流】,完整手册自动发给你。

【声明】内容源于网络
0
0
我的Ai笔记
很干货、有深度、真免费,关注“我的Ai笔记”,每天学Ai技巧! 赋能客户、助力普通人在Ai时代抢占先机。
内容 444
粉丝 1
我的Ai笔记 很干货、有深度、真免费,关注“我的Ai笔记”,每天学Ai技巧! 赋能客户、助力普通人在Ai时代抢占先机。
总阅读24.3k
粉丝1
内容444