DeepSeek追上Kimi了吗?

2026-08-14 02:25:24 · chineseheadlinenews.com · 来源: AIX财经

盼望着,盼望着,DeepSeek-V4-Pro正式版终于来了。

这次发布,过程还有点曲折。8月12日晚,DeepSeek官方API定价页悄然发生变化,DeepSeek-V4-Pro对应版本已经更新为DeepSeek-V4-Pro-0813,新模型先在API端静默上线了。

8月13日下午,DeepSeek官网的发布通知以及开放平台公告被撤回,不过模型仍然显示在模型与价格页面中。到了13日晚间,DeepSeek重新发布公告,确认正式版已同步登陆APP、网页端和API。

正式版继续往长任务和Agent方向走。它延续了1M上下文、384K最大输出等规格,同时支持非思考和思考模式,思考模式默认开启。1M上下文可以一次塞进更大的代码库和文档,384K最大输出则给连续编程、复杂Agent任务留下了更大的执行空间。

除此之外,正式版还新增了low、high、max三档思考强度,并原生支持Responses API。对应到官方公布的基准成绩上,它的重点能力也比较明确,主要集中在Coding、Agent、工具调用和复杂任务执行。

DeepSeek这次也涨价了。从8月17日开始,DeepSeek API将采用峰谷定价:每天9:00-12:00、14:00-18:00为高峰时段,其余为空闲时段,空闲价格为高峰的一半。以DeepSeek-V4-Pro为例,空闲时段缓存未命中输入、输出价格将从目前的3元、6元涨至4.5元和13.5元,高峰时段则达到9元和27元。

配置摆在这里,价格也涨了,那实际能力到底如何呢?

要判断DeepSeek-V4-Pro处在什么水平,Kimi K3是一个很合适的参照物。Kimi K3是上个月发布的旗舰模型,在Coding和Agent相关榜单上表现突出,且两款模型瞄准的能力区间高度重合。我们具体来看一下基准成绩的对比。

DeepSeek-V4-Pro正式版 VS Kimi K3跑分对比图

从上图可以看出,两款模型没有出现谁把谁完全甩开的情况,而是各自守住了几块优势。Kimi K3更占优的项目,大多集中在长程软件工程和连续任务执行。DeepSeek-V4-Pro正式版则在自动化、安全以及部分高难任务上更占优势。

跑分只能说明一部分问题。真正放进具体任务里,两款模型谁更会干活?我们选了四类任务,用同一套提示词分别交给两款模型,看看谁的表现更好。

不过,需要说明的是,我们是在DeepSeek-V4-Pro正式版尚未上线App和网页端时开始测试的,使用方法是将它接入Codex使用;Kimi

K3则直接在Kimi

Work中调用。这意味着在编程、网页生成和文件操作等任务里,最终表现除了模型本身,也可能受到工具链和运行环境影响。另外,本次测试均为单次生成结果,模型输出存在一定随机性,结果仅供参考。

接下来,我们一起看看它们的实际表现。

01.内容创作:DeepSeek更会讲故事,Kimi更会做报告

我们先从最容易暴露模型“表达习惯”的内容创作开始。

我们设计了两道题:一道考故事续写,看模型能不能理解人物、延续叙事;另一道考行业报告,看它能不能从大量信息里抓住重点、组织观点。

我们先让两款模型为近期爆火的AI漫剧《被裁掉的女孩》续写第二季,从第一季女主角方桃子结束巴黎时装周、回到上南城的第二天开始,写一个1000字左右的故事。要求延续第一季的现实风格,不走一路开挂的爽文路线,而是继续讨论行业规则、舆论压力和自我价值等更现实的问题。

写故事对大模型来说不算难,难的是不暴露“AI味”。从结果来看,两款模型都没有完全逃过这个问题。还需要说明的是,即便做了简单的介绍,它们对具体的人物依旧不了解,给出的故事人物和原剧设定有出入。

先来看DeepSeek-V4-Pro正式版的成品,有“AI味”但至少故事线是顺的。

DeepSeek-V4-Pro正式版生成的故事

Kimi

K3的问题更明显,它没有完全分清“背景资料”和“故事正文”。我们在提示词中简单回顾第一季,只是为了帮助模型理解人物和前情。结果Kimi

K3在故事里写了几句类似“第一季里陪她熬过来的助理小满”的句子,正常的续集不会突然站在观众视角提醒这是第一季的人物和情节,很容易出戏,也让整篇故事的衔接不够流畅。

Kimi K3生成的故事

接着,我们把内容创作从文学拉回工作场景,让它们分别写一份2026年AI编程工具行业竞争格局分析报告。

DeepSeek-V4-Pro正式版给出的框架比较清楚。它按照行业演变、全球格局、中国市场等维度展开,也会结合公司案例和数据支撑判断。不过,整体内容偏少,对头部产品竞争关系、市场变化等问题点到了但没有进一步展开。

Kimi K3则明显更“能搜罗”。它不仅整理了市场辨模、采用率、国内外市场份额、产品定价等信息,还通过大量表格把不同公司和产品放在一起比较,呈现上更直观。论证也比较有条理,结尾还附上了信息来源。

这一轮,它们各赢一题。DeepSeek-V4-Pro正式版更会把故事讲顺,Kimi K3则更会收集和整理信息。

02.编程:DeepSeek修改快,Kimi还原准

接下来,进入两款模型都很受关注的编程场景。

我们先从最常规的前端网页开始,让它们做一个“电影选片器”。网页需要内置至少24部经典电影,支持按类型和评分筛选,再通过“随机选一部”不断抽选。这道题本质上是前端综合题,主要考察模型能不能把数据、筛选逻辑、交互和视觉效果装进一个HTML文件。

Kimi K3生成的电影网页

两款模型交出来的结果相当接近。它们都选择了深色背景,把筛选条件放在页面上方,中央用电影卡片承载抽选结果,类型筛选、评分区间、“换一部”等核心功能也都正常实现。

DeepSeek-V4-Pro正式版生成的电影网页

DeepSeek-V4-Pro正式版的问题出在一个小细节。它在电影卡片中央加入了胶片图标,本意可能是为了增强氛围,但在部分加载情况下,图标会与文字发生重叠,影响观感。

这一题差距不大,于是我们把要求提高了一档,给它们两张艺术博物馆官网的截图,让它们据截图还原网页。这道题要求模型不仅要会写代码,还得先真正“看懂”页面。

艺术博物馆官网的截图

这一轮,差距明显拉开。DeepSeek-V4-Pro正式版的成品“不能说一模一样,只能说毫不相关”,它仅仅抓住了截图的色调,没有真正还原截图表达的内容。原图明明是艺术博物馆官网,它最终做出来的却是品牌官网。

DeepSeek-V4-Pro正式版还原的网页

Kimi K3的还原更准确。官网的整体结构、模块都保留下来,和原截图相当接近。比较明显的差别主要在图片素材,原截图的首页主视觉和部分页面使用了实景照片,Kimi K3没有原始素材,用几何图形进行了替代。

Kimi K3还原的网页

我们再把难度继续拉高,让它们做一款威尼斯运河快艇游戏。玩家要控制快艇,在倒计时结束前沿运河穿过桥洞,最终抵达码头。我们还要求加入晾衣绳、水面倒影等细节。

两款模型都交出了能玩的游戏,但侧重点不太一样。DeepSeek-V4-Pro正式版把要求的运河两侧建筑、桥洞和晾衣绳等大部分元素都还原了,整体完成度不错。不过,它漏掉了一个细节,水面没有呈现建筑的倒影。此外,晾衣绳上的衣服虽然存在,但悬挂状态比较生硬,多少有一点“贴”上去的感觉。

我们随后临时加了一道题,把原本相对规整的桥洞改成交错分布,增加游戏难度。DeepSeek大约5分钟完成修改,调整后的桥洞交错,且船不能直接穿墙而过,游戏逻辑基本成立。

DeepSeek-V4-Pro正式版生成的游戏

Kimi

K3这一轮在视觉上更胜一筹。两侧建筑、晾晒的衣物处理得更自然,水面也能够看到房屋倒影,整个运河美感更强。尤其同样是“晾衣绳”,两边都做了,但Kimi

K3会进一步处理衣物悬挂状态,更像真实场景。此外,它还加入了快艇行驶、穿过桥洞得分等音效,游戏的沉浸感也更强。

我们同样要求它把桥洞改成交错分布。修改后的游戏能正常运行,碰撞逻辑也没有明显问题,不过这一轮它花了大约10分钟,是DeepSeek-V4-Pro正式版的两倍。

Kimi K3生成的游戏

这一轮,两款模型在纯前端功能实现上的差距并不大,真正拉开差距的是复杂需求下的理解和执行方式。Kimi K3更擅长还原视觉要求,成品细节也更完整;DeepSeek-V4-Pro正式版虽然视觉表现稍逊,但二次修改速度更快,对明确指令的响应也更直接。

03.视觉审美:DeepSeek先卡壳,Kimi一次“出片”

接下来,我们再看看视觉审美。

我们让两款模型用Three.js还原水母湖,画面里要有大量金色水母随着光线迁徙,在碧绿海水中形成近似“金色星河”的效果;同时还要表现水面光束、丛林倒影、鱼群和不同远近层次的水母。这道题也在考验模型能不能理解一段偏文学化的视觉描述,再把“金色星河”“发光云团”这些抽象要求翻译成具体画面。

DeepSeek-V4-Pro正式版先卡了几次。它半小时后交出的首个成品,打开页面一片空白;第一次修改后又出现渲染错误;直到第二次调整,场景才正常显示,但页面上仍留有一行渲染错误提醒。

DeepSeek-V4-Pro正式版生成的水母湖

再具体看成品,它对视觉呈现的理解也偏了。我们想要的是金色水母密集分布,在水中形成像星河一样的发光云团。DeepSeek的成品却在海水里铺了大量金色光点,而真正的水母则被处理成灰色椭圆状物体。结果“星光”有了,“金色水母群”这个主角反而没有体现。

它的整体色调也偏暗,更像置身较深的水底,看不出水面和阳光穿透的层次感。不过,它倒是体现了水下植物丛,背景环境铺得比较全。

Kimi K3则花了大约40分钟,一次交出了可以正常运行的成品。它的理解更准确,画面里能看到密集的金色水母群,不同远近的水母形成明显层次,基本呈现出了要求的“金色星河”。

Kimi K3生成的水母湖

除了水母,画面中能看到鱼群、水面以及从上方洒下来的光束,整体风格也更偏写实,画面也更加精美。不过,我们要求水下能够看到植物,它的成品里基本没有呈现。

这一轮两者的差距依然比较明显。DeepSeek视觉表现稍弱,首轮运行的稳定性也还有提升空间;Kimi的理解和审美完成度更高。

04.物理仿真:Kimi跑通逻辑,DeepSeek卡在穿模

最后,我们把难度拉满,进入一个更容易露馅的场景:物理仿真。

我们让它们用Three.js制作一个“鞭炮箱子”的3D连锁爆炸演示。100个鞭炮落入箱中后,要完成点燃、爆炸、弹射和连锁引燃,同时处理碰撞、碎片和烟雾等效果。

这道题最重要的是物理逻辑和因果链能不能成立,鞭炮掉下来不能穿模、爆炸不能凭空发生,被冲击的鞭炮也要符合运动规律。

Kimi

K3大约用了10分钟就交出了结果,整体完成度比较高。鞭炮从上方落入透明箱子后,会留在箱体内部,没有明显穿模。点击“开始燃放”后,一个已经点燃的鞭炮从外部落入箱中,再逐渐引燃周围的鞭炮,整个过程至少在视觉上有清楚的因果关系。燃放的反应也比较写实,能看到明显的烟雾和气团效果。

Kimi K3生成的“鞭炮箱子”

单个引爆模式也和正常燃放做了区分,可以直接选择箱内某个鞭炮点燃,再从这个位置向周围触发连锁反应。这样一来,正常燃放是外部点火,单个引爆是局部触发,两条逻辑都连贯,更像一套完整的仿真演示。

DeepSeek-V4-Pro正式版就要曲折得多,前后花了接近40分钟。首先出现了碰撞问题,鞭炮从上方落入箱子的过程中会直接穿过箱体,说明最基础的碰撞约束没有成立。到了点燃环节,箱内某个鞭炮突然冒出火星,开始连锁爆炸,缺少火源的过渡。它可能想展示爆炸后的气体形成的气团,但最终呈现像短暂白屏。而且整个爆炸过程明显卡顿,多次运行也没有明显改善。

DeepSeek-V4-Pro正式版生成的“鞭炮箱子”

单个引爆模式没有和正常燃放拉开明显差别,依旧是某个位置突然出现火星,随后进入同样的爆炸流程。按钮虽然有了,但对应的交互逻辑并没有真正做出区分。

这一轮,Kimi K3明显更稳,更能把物理规律落实到运行逻辑里;DeepSeek-V4-Pro正式版则在基础碰撞和因果链上掉了链子。

05.结语

几轮测下来,我们发现,DeepSeek-V4-Pro正式版在内容创作上叙事更顺;编程任务里,它的修改速度也更快。但在需要理解视觉信息的任务中,表现有待提升。截图还原、3D视觉和物理仿真任务中,Kimi K3对画面的理解更准确,成品完成度也更高。

所以,DeepSeek-V4-Pro正式版依然能打,只是没有做到全面领先。考虑到它依然保持了较低的价格,性价比仍然突出。在旗舰模型里,“够用且便宜”本身就是竞争力。

一直以来,DeepSeek最鲜明的标签,是用相对低的价格,提供足够强的模型能力。到了DeepSeek-V4-Pro正式版,这套逻辑发生了一些变化,API将采用峰谷定价,虽然给开发者留下了通过错峰调用控制成本的空间,但“绝对低价”已经不再像过去那么突出。

模型表现之外,DeepSeek背后的深度求索自己正在变“重”。

6月,深度求索启动大规模的公开招聘,提出希望各部门规模至少扩大一倍,岗位从算法研发扩展到产品、数据工程、运维等方向。与此同时,DeepSeek官网招聘页面开始频繁出现Agent Harness、Agent Infra以及通用Agent数据产品经理等岗位。

8月13日晚,DeepSeek

Harness开发者预览版正式开放测试,并同步以MIT协议开源。这套系统解决的是模型“怎么干活”的问题,模型、工具、存储等能力都可以通过插件自由组合。相比直接做一个面向用户的Agent产品,DeepSeek选择先搭一套开放的Agent运行框架,把能力从模型层进一步延伸到Agent基础设施。

团队和产品都在扩张,背后也需要更多资金支撑。DeepSeek过去长期依靠幻方体系提供资金,并一度拒绝外部融资。今年策略明显改变,6月完成首次外部融资,规模超过500亿元,此后又继续推进新一轮融资。

所以,DeepSeek-V4-Pro正式版之后,还有两个更值得观察的问题。

第一,涨价之后,DeepSeek还能不能守住“高性价比”。模型规模扩大、Agent任务变长,都在增加算力消耗和成本压力。价格不再足够低之后,它需要靠更强的任务完成能力和更高的调用效率,证明自己依然“值”。

第二,DeepSeek能不能真正进入用户工作流。目前的Harness仍主要面向开发者。接下来更关键的是,DeepSeek会不会进一步推出面向普通用户或企业的Agent产品,把这些能力变成真正可用的工作流。只有走到这一步,DeepSeek才能获得更直接的真实任务反馈,也才能把模型能力进一步转化成产品优势。


    24小时新闻排行榜更多>>
  1. 朱镕基离世 许多谜底有了答案
  2. 纽约布碌崙华人社区6203号地下室突遭搜查
  3. 困扰数学圈22年的难题,被协和实习医生解决了?
  4. 被制裁几十年,伊朗咋还越来越强硬?
  5. 郭德纲暴雷仅1天,陈年旧事被扒干净
  6. 川习会成果卡关 美中投资委员会5月成立后未曾磋商
  7. 习近平做一事惹怒41国 现代8国联军要中方给交代
  8. 朱镕基去世时间有疑?五前常委去世 今年十将领身亡
  9. 《十万个为什么》为何被打成大毒草?
  10. 知情人爆朱镕基被蔡奇人马贴身监视 旧部落马、病亡
  11. 薄毕瓜发文悼念朱镕基 引发海外华人热议
  12. 三星堆最诡异的谜团是什么?
  13. 男子将收款码贴功德箱上,3天收款900多元
  14. 闪迪豪言:2028-30营收中高双位数增长
  15. 美国7月PPI同比涨幅收窄至4.7%
  16. 川普政府开发AI工具 打击“协助中国”的贸易伙伴
  17. 纽约要开“供销社”?美式“社会主义”能玩多久?
  18. 市场不再完全押注美联储年内加息
  19. 升糖最快的主食被揪出,是米饭的4倍
  20. 中国多行业限制出境延至体制外 海关严查很多人被劝返
  21. 39岁的他猝死公司马桶上 官方:没在座位不算工伤
  22. WSJ:人去了哪里?三星堆最诡异的谜团是什么?
  23. 朱同志如何面对人生低谷?那20年他很少对外讲起…
  24. 2028年民主党总统候选人仍不明确
  25. 大众电影百花奖投票结果公布,王宝强获得0票
  26. 马斯克打开了魔盒?美国CEO开始纷纷拿天价薪酬
  27. 白宫新报告《大转运骗局》 控40多国帮中国逃关税
  28. 扎克伯格:与中国相比,美国有个明显劣势
  29. WorkBuddy上线远程控制
  30. 《我的前半生》“诈尸”翻红了
  31. 巴拿马运河大堵船 平均等10天 有货轮花400万“插队”
  32. 中国年轻人海外求学为何降温?
  33. “最会拍姐弟恋”的传奇导演,突然去世
  34. 这次百花奖,扯下内娱遮羞布
  35. 30年期美债标售得标利率创新高
  36. 7年亏掉2亿,邹市明45岁“听老婆的话”重返拳击场
  37. 以国防部长誓言:继续驻留黎巴嫩
  38. 福建一船厂起火救援时发生爆炸 致12伤含10名消防员
  39. 谷歌推出Gemini 3.7 Flash模型
  40. 太子集团又一“幕后大佬”找到了?美检方披露身份
  41. 卢比奥上节目 爆战争部长家的猫和肯尼迪“酸菜”趣事
  42. 董卿被造黄谣,评论区不堪入目
  43. 中国靠40国“洗产地”躲关税!白宫公布名单
  44. 暑假去了一趟天安门广场 游客:到最后快崩溃了
  45. DeepSeek Harness开发者预览版:一切皆插件
  46. 朱镕基国企改革 工人失业血泪 东北、南方老哥争不休?
  47. 中国催婚新招:银行也能办结婚证
  48. 500美元起家致富!币圈大亨坠楼前诡异 爆粗对话曝
  49. 一只“白海豚”,凭什么浇透小半个中国?
  50. 郭德纲被立案后,我有一个问题不敢大声问…
  51. 战争进入第7个月 伊朗究竟还能撑多久?
  52. 75岁郭台铭被爆出轨,妻子发文
  53. 阎王爷喂饭:4月4日生,高考444分,考进殡葬系
  54. 川普关税战重大胜利 取消小额包裹免税裁定合法
  55. 王思聪5年前组装"神级电脑" 竟成理财产品?打破贬值定律
  56. 智谱发布GLM-5.3模型,性能比肩Fable 5
  57. 郭麒麟登顶热搜第一,瘦到认不出
  58. 江泽民官方纪录片触及六四 形容1989年“临危受命”
  59. 英伟达正在效仿AIG?
  60. 人生九件大事 你完成了几件?