最近AI圈子真是热闹得不行,前脚 DeepSeek V4 Pro 正式版和 DeepSeek Harness (DSH)刚同步上线,后脚智谱就扔出了全新的 GLM-5.3 模型,听说这个5.3版本基座跟5.2一样都是743B参数,但靠着后训练,性能竟然直接飙升了50%!
说实话,新模型是一个接一个,根本测不过来啊,感觉我们这些站长和开发者,还没消化完一个,下一个就又来了。
既然现在GLM、DeepSeek、Kimi这几家国产大模型打得这么火热,不如直接把它们拉到同一个擂台上来真刀真枪地比试一番,这样大家肯定更想看了吧。
DeepSeek Harness 最近热度很高,它最棒的一点就是支持接入第三方模型,这简直就是给咱们这些想做模型对比测试的站长量身定制的。于是我就琢磨着,干脆把DSH当成一个统一的评测工具,把这三家的最新模型统统塞进去,让它们在完全一致的工具链环境下跑任务,这样除了模型本身,其他变量都控制住,尽可能做到公平对比。
别的不说,光是把这几个模型接入DSH,就已经是个值得分享的经验了。今天我就先手把手教你怎么把智谱的 GLM-5.3 接入 DeepSeek Harness,后面再聊聊我跑了两个实战项目后,这些模型到底表现如何。
如果没有这么多API额度,可以选择硅基流动的API,任选大模型,免费16元调用额度,免费上亿token!
点个收藏,咱们这就开整。
一、把 GLM-5.3 接入 DeepSeek Harness
首先,咱们得把 GLM-5.3 模型接入到 DeepSeek Harness 里。这里我就以 GLM-5.3 作为例子,Kimi K3 的接入方法也是大同小异。如果你是DeepSeek Harness的新手,还没安装或者用过,可以先去百度一下,从安装到上手也就几分钟的事儿,里面还有视频教程链接,照着一步步操作就行。
这里我就直接讲讲怎么在已经部署好的 DeepSeek Harness 里添加第三方模型。
- 打开 DSH 的 Web 界面,点击左下角的“设置”按钮。 这个设置按钮藏得比较深,新手可能要找一下。

- 进入“模型”标签页,然后找到并点击“添加提供方”。

- 选择模型提供方为
zai-coding-cn。 接着,你需要去智谱开放平台(https://bigmodel.cn/coding-plan/personal/overview)获取你的API Key,然后把它粘贴到DSH对应的输入框里。
- 展开自定义设置,点击“获取可用模型”。 不过,因为 GLM-5.3 实在是太新了,DeepSeek Harness 的模型列表可能还没来得及更新,它默认是不会被自动拉取到的。所以,我们得手动操作一下,点击“添加模型”,然后填入
glm-5.3,最后记得保存。
大功告成!现在你就可以在DeepSeek Harness的对话框里,轻松选择并使用 GLM-5.3 模型了。是不是很简单?
用同样的方法,你可以把 Kimi K3 也加进来。至于 DeepSeek V4 Pro,它通常在DSH安装成功后就默认接入了,不用你再额外配置,省心不少。
等这三个模型都安顿好了,咱们的PK赛就可以正式拉开序幕了。
二、测试说明:确保公平性
为了这次大模型横评尽可能做到公平公正,我可是煞费苦心。所有三个模型都会在 DeepSeek Harness 的标准模式下运行,统一使用各自模型的默认推理档位,工具链环境完全一致,连输入的提示词都一字不差。最关键的是,整个测试过程我不会做任何人工干预,提示词一给,就让AI自己独立跑到任务结束。
DSH这里做得也很到位,它会自动扫描我本地安装的技能目录,比如我装了 Firecrawl 的联网搜索技能、Context7 的文档查询技能等。这意味着在跑任务时,所有三个模型都能公平地使用这些辅助技能来搜索资料,避免了因外部工具差异导致的结果偏差。
三、实战 1:致敬《牛来》的 3D 网页跑酷游戏
最近一部国产动画电影《牛来》真是火遍了全网,虽然剧情和建模有点抽象,但那种“反向爆火”的魔力,让它从上映第一天的3420元票房,短短十几天就冲到了900多万,属实是奇迹。半佛老师那句“如果你花了30块去看了《牛来》,那说明你真的有30块钱”,简直是精辟。
既然它这么“独树一帜”,我就决定让这三个模型,来个致敬《牛来》的“3D 网页跑酷游戏”。在给提示词的时候,我故意没有做太多功能和技术上的约束,就是想看看模型们各自能发挥到什么程度,能不能把电影里的一些“灵魂元素”给还原出来。我特别强调了要用 Loop Engineering 的方式来推进,就是做完一步自己验证一步,出了问题自己修复,这很考验AI的自主思考和纠错能力。
好了,游戏开始!
GLM-5.3 成品效果:细节拉满,可玩性爆棚
首先登场的是 GLM-5.3 的版本。
进入游戏主界面,首先看到一段故事描述,有看过《牛来》的朋友肯定会觉得,这个描述跟电影剧情的契合度相当高:草原上的小牛犊牛来,跟随云雀坠入一场大梦,穿过迷雾、狼群与轰鸣的伐木场,唯有向前奔跑才能学会勇敢……这简直就是电影精神的完美再现,还挺励志的。
进入第一关“晨曦草原”,你别说,这个牛的建模真的挺抽象的,尤其是那双直勾勾盯着你的眼睛,那种魔性一下子就出来了!旁边还有一只云雀好友陪着牛牛一起向前奔跑,电影里那个味儿,GLM-5.3 抓得死死的。
游戏操作支持左右移动、跳跃和滑铲,手感出乎意料的流畅,玩起来还挺带劲的,可玩性相当不错。
吃到一定数量的幸运草之后,竟然还能释放大招,进入“豹拉疾冲”状态,这可是全屏加速加无敌!“豹拉”是电影里牛来的好朋友,这个大招命名,真是充满了电影的梗,让人会心一笑。
游戏不仅有多个关卡,而且每一关的主题和机制都各有不同。比如“狼群夜袭”这关,你真的会被身后的狼群追逐,还有一个叫做“妈妈的守护”的技能,简直是剧情杀,让人直接泪目。
可惜,我的牛牛最终还是倒在了第四关。看看这个死亡结算画面,我真的没绷住,怎么还喷出一团血花了呢?这细节,真的绝了!
DeepSeek V4 Pro 成品效果:中规中矩,但略显粗糙
接下来是 DeepSeek V4 Pro 的版本。
主界面做得还算像模像样,也还原了云雀和牛来的故事背景。![]()
进入游戏,额…… 怎么说呢?这界面干净得一塌糊涂啊!除了主角牛牛和两边的云雀、豹拉,基本没什么场景细节了。不过,它确实把云雀和好友豹拉都还原出来了,它们会陪着牛牛一起奔跑。
移动、跳跃和滑铲功能都是正常的,但看到这个滑铲效果,我真的没绷住……好家伙,牛牛的眼珠子都给我铲出来了?这建模确实有点简陋了。
仔细看,道路两侧的图标明显是飘在草坪上面的,有点违和。而且整个游戏节奏偏慢,刚开局跑了好久第一个障碍物才出现,没什么技能,也没什么特殊的关卡机制,可玩性比较差。
牛牛只有一条命,撞到石头之后直接就进入死亡结算画面了,整体来看,只能说中规中矩吧,没啥亮点。![]()
Kimi K3 成品效果:画面还行,但性能和玩法是硬伤
最后是 Kimi K3 的版本。
主界面的配色平平无奇,跟其他模型一样,也把电影剧情简单概括了一下。
进入游戏,界面风格还可以,远处的山峦绘制得挺不错的。但是主角牛牛就显得平平无奇了,不够抽象,看起来就是一组普通的方块,缺乏电影那种魔性的特质。
虽然牛牛有3条命,也可以吃金币,但整个游戏就是单纯的跑跑跑,没什么技能,也没有特殊机制。我的豹子朋友和云雀呢?怎么都没了?还有这个下雨效果,直接来一个全屏网格,这就有点敷衍了吧……
而且最致命的问题是,整个游戏时不时会出现明显的卡顿,帧率不够稳定,这在跑酷游戏里可是致命伤。![]()
最后是平平无奇的结算画面,没啥亮点。
实战 1 对比:GLM-5.3 遥遥领先
三个版本的跑酷游戏都测试完了,结果应该很明显了吧。
- GLM-5.3 的版本完成度最高,多关卡、多技能,对电影剧情的还原度非常强,可玩性远超其他两个模型。
- DeepSeek V4 Pro 实现了游戏的基本玩法,但节奏偏慢,细节处理也比较粗糙,让人感觉就是个半成品。
- Kimi K3 虽然场景画面还过得去,但游戏机制太过单一,缺乏特色,而且还有恼人的卡顿问题,体验感很差。
综合来看:
- 前端效果:GLM ≈ Kimi > DeepSeek
- 可玩性:GLM > DeepSeek > Kimi
- 画面抽象程度:GLM > DeepSeek > Kimi (毕竟是致敬《牛来》嘛,抽象就是精髓)
整体游戏完成度上,GLM-5.3 真是遥遥领先,表现突出。
四、实战 2:AI 绘图工具,考验全栈工程能力
上一个任务是纯前端的3D游戏,这第二个任务当然要换个方向,来彻底考验一下模型的全栈工程能力。
我让这三个模型开发一个“AI 绘图工具”,用户的需求很简单:输入自然语言描述,后端调用大模型生成 draw.io 格式的图表XML,然后前端把这个 draw.io 开源编辑器嵌入进去,用户可以直接在线编辑和修改生成的图表。
这个任务可不简单,它同时考验模型对 draw.io 开源代码的理解、后端AI调用链路的设计、前端复杂组件的集成,以及最重要的——整体产品设计的合理性。为了方便测试,我直接在提示词里把API Key提供给了AI,省去了AI自己去配置环境变量的步骤。
GLM-5.3 成品效果:产品级体验,深度融合
先来看看 GLM-5.3 的效果。
整个页面设计很有科技感,左侧是AI对话框,右侧是画布编辑器,布局清晰合理。产品引导做得也很到位,直接告诉你“可以用一句话画出专业图表”,还贴心地给出了几个示例类型。
我尝试让AI帮我画出 DeepSeek Harness 的架构图。在生成过程中,你可以实时看到AI深度思考和生成XML代码的过程,右侧的画布还会显示一个炫酷的Loading动画,这种实时反馈感非常棒。
生成完成后,右侧立刻就渲染出了完整的架构图,分层清晰,而且完美保留了 draw.io 原本的元素编辑能力,可以直接拖拽、修改,就像在用原版 draw.io 一样。
更强的是,它居然支持连续对话修改。比如我说“帮我把 DeepSeek Harness Core 这里变成红色”,AI 就能精准定位到对应的元素并修改样式,右侧画布实时更新,这种交互体验,简直是产品级的!
整体效果非常不错,图片导出功能也能正常使用。而且你会发现 GLM-5.3 把 draw.io 的编辑能力深度融合进了自己设计的界面中,看起来就像一个完整的产品,而不是生硬地嵌入了一个第三方组件,这点很难得。
DeepSeek V4 Pro 成品效果:核心功能勉强实现,但用户体验欠佳
再来看看 DeepSeek V4 Pro 的表现。
打开界面,右侧画布竟然是一片空白,只有一个大大的Loading图标?而且左下角的提示文字还出现了溢出,这前端表现,DeepSeek V4 Pro 确实有点拉胯了。
AI生成图表的功能倒还是可以正常使用的,但是没有实时展示AI思考过程的能力,你只能傻等着它全部生成完了,才能看到结果,交互体验差了一大截。
最关键的是,DeepSeek V4 Pro 很明显是直接把 draw.io 整个嵌入到了前端页面中,没有做任何深度集成。这种感觉就像是硬生生把两个东西粘在一起,而不是巧妙地融合,跟 GLM 那种把 draw.io 能力自然融入自己界面中的做法差距明显。
Kimi K3 成品效果:前端不错,但后端稳定性是短板
最后看 Kimi K3。
Kimi K3 这次生成的界面布局跟 GLM 类似,也把 draw.io 自然融合到了项目中,整体界面风格非常Nice,看起来也挺舒服的。
AI生成图表的功能正常,同样支持连续对话修改,这说明Kimi在前端交互设计上还是下了功夫的。
但是,我发现它的后端逻辑明显没做好提示词约束和工具校验,有时候AI生成的内容会直接翻车,把一大段XML源码直接糊在界面上,而不是渲染成图形,这可就尴尬了。
整体来看,Kimi K3 的前端设计能力跟 GLM-5.3 旗鼓相当,但在后端稳定性上却明显差了一截,还需要打磨。
实战 2 对比:GLM-5.3 依旧领先
在这个全栈绘图工具的任务里,GLM-5.3 的综合表现依然是最好的,无论是界面设计、AI深度思考的实时展示、连续对话修改,还是 draw.io 的深度融合,每一个环节都处理得非常到位,给人一种完整产品的体验。
Kimi K3 的前端设计能力很强,但可惜后端逻辑偶尔会翻车,影响了整体的用户体验。
DeepSeek V4 Pro 虽然也正常实现了核心功能,但是界面粗糙,组件集成方式生硬,用户体验感最差。
五、我的真实感受和成本分析
跑完这两个横跨纯前端3D游戏和全栈AI应用的实战项目,我的感受还是很深的。
很明显,即使是在 DeepSeek Harness 这个可以算是 DeepSeek 的“角色专武”主场环境下,GLM-5.3 的表现依然非常出色。这两个项目覆盖了完全不同的技术方向,但 GLM-5.3 在任务理解、代码生成质量、产品设计意识这几个维度上都明显领先,它的自主思考和纠错能力给我留下了深刻印象。
下面聊聊大家最关心的成本问题,猜猜我这次测试到底花了多少钱呢?
由于 GLM-5.3 我用的是编码套餐,不太好直接统计实际消耗金额,所以我只能拿积分来算了。两个项目累计消耗了 1151 积分,我订的是Pro套餐(538元/月),每周额度是6万积分,算下来这次的消耗只占了周额度不到2%,折算成钱,连3块钱都不到。这性价比,真是高到离谱。
Kimi K3 那边,我的套餐过期了,新的又没抢到,所以是直接用 API Key 接入,总共消耗了31.07元;而涨价之后的 DeepSeek V4 Pro 消耗了13.99元。
单从我这次实际花销来看,GLM-5.3 按照套餐计算,性价比是最高的。一周6万积分,足够你随便跑,根据我这次测试这种复杂任务的消耗情况,做几十个小项目应该是不成问题的。
在开源世界里,GLM-5.3 目前可以说是编程能力的天花板。智谱在发布文章中还提到,Hugging Face 之前遭遇安全攻击的时候,Anthropic 的 Mythos 模型只面向约150家大型机构提供服务,更多的中小企业和开源项目在最需要帮助的时候,反而用不上最强的防御工具。当攻击能力在扩散,防御能力就不能只掌握在少数人手中。GLM-5.3 的开源给所有人提供了一把防御的盾牌,这件事情本身的意义,可能比单纯的跑分高下更重要。
六、最后哔哔几句
这次横评下来,我对国产大模型的编程能力真是越来越有信心了。GLM-5.3、Kimi K3、DeepSeek V4 Pro 这几家打得不可开交,作为用户,我们真的是渔翁得利,有了更多更强的选择。
当然,每个模型都有它的长处和短板,选哪个,最终还是得看你的具体需求和预算。但从我的测试来看,如果你追求代码质量、产品设计和高性价比,GLM-5.3 绝对是目前一个非常值得深入尝试的选手。





















暂无评论内容