把GLM-5.3接入到DeepSeek Harness及设置图文教程

AI 智能摘要
说实话,最近国产大模型神仙打架,GLM-5.3靠后训练性能飙升50%。实测横评里,3D跑酷游戏它多关卡多技能,还原《牛来》精髓,产品级体验,完成度超高细节拉满,手感流畅,甚至能释放大招,可玩性碾压DeepSeek V4 Pro和Kimi K3,遥遥领先。接入DSH超简单,手把手教程,快试试吧。

最近AI圈子真是热闹得不行,前脚 DeepSeek V4 Pro 正式版和 DeepSeek Harness (DSH)刚同步上线,后脚智谱就扔出了全新的 GLM-5.3 模型,听说这个5.3版本基座跟5.2一样都是743B参数,但靠着后训练,性能竟然直接飙升了50%!

说实话,新模型是一个接一个,根本测不过来啊,感觉我们这些站长和开发者,还没消化完一个,下一个就又来了。

既然现在GLM、DeepSeek、Kimi这几家国产大模型打得这么火热,不如直接把它们拉到同一个擂台上来真刀真枪地比试一番,这样大家肯定更想看了吧。

DeepSeek Harness 最近热度很高,它最棒的一点就是支持接入第三方模型,这简直就是给咱们这些想做模型对比测试的站长量身定制的。于是我就琢磨着,干脆把DSH当成一个统一的评测工具,把这三家的最新模型统统塞进去,让它们在完全一致的工具链环境下跑任务,这样除了模型本身,其他变量都控制住,尽可能做到公平对比。

别的不说,光是把这几个模型接入DSH,就已经是个值得分享的经验了。今天我就先手把手教你怎么把智谱的 GLM-5.3 接入 DeepSeek Harness,后面再聊聊我跑了两个实战项目后,这些模型到底表现如何。

如果没有这么多API额度,可以选择硅基流动的API,任选大模型,免费16元调用额度,免费上亿token!

点个收藏,咱们这就开整。

一、把 GLM-5.3 接入 DeepSeek Harness

首先,咱们得把 GLM-5.3 模型接入到 DeepSeek Harness 里。这里我就以 GLM-5.3 作为例子,Kimi K3 的接入方法也是大同小异。如果你是DeepSeek Harness的新手,还没安装或者用过,可以先去百度一下,从安装到上手也就几分钟的事儿,里面还有视频教程链接,照着一步步操作就行。

这里我就直接讲讲怎么在已经部署好的 DeepSeek Harness 里添加第三方模型。

  1. 打开 DSH 的 Web 界面,点击左下角的“设置”按钮。 这个设置按钮藏得比较深,新手可能要找一下。
  2. 进入“模型”标签页,然后找到并点击“添加提供方”。
  3. 选择模型提供方为 zai-coding-cn 接着,你需要去智谱开放平台(https://bigmodel.cn/coding-plan/personal/overview)获取你的API Key,然后把它粘贴到DSH对应的输入框里。
  4. 展开自定义设置,点击“获取可用模型”。 不过,因为 GLM-5.3 实在是太新了,DeepSeek Harness 的模型列表可能还没来得及更新,它默认是不会被自动拉取到的。所以,我们得手动操作一下,点击“添加模型”,然后填入 glm-5.3,最后记得保存。

大功告成!现在你就可以在DeepSeek Harness的对话框里,轻松选择并使用 GLM-5.3 模型了。是不是很简单?

用同样的方法,你可以把 Kimi K3 也加进来。至于 DeepSeek V4 Pro,它通常在DSH安装成功后就默认接入了,不用你再额外配置,省心不少。

等这三个模型都安顿好了,咱们的PK赛就可以正式拉开序幕了。

二、测试说明:确保公平性

为了这次大模型横评尽可能做到公平公正,我可是煞费苦心。所有三个模型都会在 DeepSeek Harness 的标准模式下运行,统一使用各自模型的默认推理档位,工具链环境完全一致,连输入的提示词都一字不差。最关键的是,整个测试过程我不会做任何人工干预,提示词一给,就让AI自己独立跑到任务结束。

DSH这里做得也很到位,它会自动扫描我本地安装的技能目录,比如我装了 Firecrawl 的联网搜索技能、Context7 的文档查询技能等。这意味着在跑任务时,所有三个模型都能公平地使用这些辅助技能来搜索资料,避免了因外部工具差异导致的结果偏差。

三、实战 1:致敬《牛来》的 3D 网页跑酷游戏

最近一部国产动画电影《牛来》真是火遍了全网,虽然剧情和建模有点抽象,但那种“反向爆火”的魔力,让它从上映第一天的3420元票房,短短十几天就冲到了900多万,属实是奇迹。半佛老师那句“如果你花了30块去看了《牛来》,那说明你真的有30块钱”,简直是精辟。

既然它这么“独树一帜”,我就决定让这三个模型,来个致敬《牛来》的“3D 网页跑酷游戏”。在给提示词的时候,我故意没有做太多功能和技术上的约束,就是想看看模型们各自能发挥到什么程度,能不能把电影里的一些“灵魂元素”给还原出来。我特别强调了要用 Loop Engineering 的方式来推进,就是做完一步自己验证一步,出了问题自己修复,这很考验AI的自主思考和纠错能力。

好了,游戏开始!

GLM-5.3 成品效果:细节拉满,可玩性爆棚

首先登场的是 GLM-5.3 的版本。

进入游戏主界面,首先看到一段故事描述,有看过《牛来》的朋友肯定会觉得,这个描述跟电影剧情的契合度相当高:草原上的小牛犊牛来,跟随云雀坠入一场大梦,穿过迷雾、狼群与轰鸣的伐木场,唯有向前奔跑才能学会勇敢……这简直就是电影精神的完美再现,还挺励志的。

进入第一关“晨曦草原”,你别说,这个牛的建模真的挺抽象的,尤其是那双直勾勾盯着你的眼睛,那种魔性一下子就出来了!旁边还有一只云雀好友陪着牛牛一起向前奔跑,电影里那个味儿,GLM-5.3 抓得死死的。

游戏操作支持左右移动、跳跃和滑铲,手感出乎意料的流畅,玩起来还挺带劲的,可玩性相当不错。

吃到一定数量的幸运草之后,竟然还能释放大招,进入“豹拉疾冲”状态,这可是全屏加速加无敌!“豹拉”是电影里牛来的好朋友,这个大招命名,真是充满了电影的梗,让人会心一笑。

游戏不仅有多个关卡,而且每一关的主题和机制都各有不同。比如“狼群夜袭”这关,你真的会被身后的狼群追逐,还有一个叫做“妈妈的守护”的技能,简直是剧情杀,让人直接泪目。

可惜,我的牛牛最终还是倒在了第四关。看看这个死亡结算画面,我真的没绷住,怎么还喷出一团血花了呢?这细节,真的绝了!

DeepSeek V4 Pro 成品效果:中规中矩,但略显粗糙

接下来是 DeepSeek V4 Pro 的版本。

主界面做得还算像模像样,也还原了云雀和牛来的故事背景。

进入游戏,额…… 怎么说呢?这界面干净得一塌糊涂啊!除了主角牛牛和两边的云雀、豹拉,基本没什么场景细节了。不过,它确实把云雀和好友豹拉都还原出来了,它们会陪着牛牛一起奔跑。

移动、跳跃和滑铲功能都是正常的,但看到这个滑铲效果,我真的没绷住……好家伙,牛牛的眼珠子都给我铲出来了?这建模确实有点简陋了。

仔细看,道路两侧的图标明显是飘在草坪上面的,有点违和。而且整个游戏节奏偏慢,刚开局跑了好久第一个障碍物才出现,没什么技能,也没什么特殊的关卡机制,可玩性比较差。

牛牛只有一条命,撞到石头之后直接就进入死亡结算画面了,整体来看,只能说中规中矩吧,没啥亮点。

Kimi K3 成品效果:画面还行,但性能和玩法是硬伤

最后是 Kimi K3 的版本。

主界面的配色平平无奇,跟其他模型一样,也把电影剧情简单概括了一下。

进入游戏,界面风格还可以,远处的山峦绘制得挺不错的。但是主角牛牛就显得平平无奇了,不够抽象,看起来就是一组普通的方块,缺乏电影那种魔性的特质。

虽然牛牛有3条命,也可以吃金币,但整个游戏就是单纯的跑跑跑,没什么技能,也没有特殊机制。我的豹子朋友和云雀呢?怎么都没了?还有这个下雨效果,直接来一个全屏网格,这就有点敷衍了吧……

而且最致命的问题是,整个游戏时不时会出现明显的卡顿,帧率不够稳定,这在跑酷游戏里可是致命伤。

最后是平平无奇的结算画面,没啥亮点。

实战 1 对比:GLM-5.3 遥遥领先

三个版本的跑酷游戏都测试完了,结果应该很明显了吧。

  • GLM-5.3 的版本完成度最高,多关卡、多技能,对电影剧情的还原度非常强,可玩性远超其他两个模型。
  • DeepSeek V4 Pro 实现了游戏的基本玩法,但节奏偏慢,细节处理也比较粗糙,让人感觉就是个半成品。
  • Kimi K3 虽然场景画面还过得去,但游戏机制太过单一,缺乏特色,而且还有恼人的卡顿问题,体验感很差。

综合来看:

  • 前端效果:GLM ≈ Kimi > DeepSeek
  • 可玩性:GLM > DeepSeek > Kimi
  • 画面抽象程度:GLM > DeepSeek > Kimi (毕竟是致敬《牛来》嘛,抽象就是精髓)

整体游戏完成度上,GLM-5.3 真是遥遥领先,表现突出。

四、实战 2:AI 绘图工具,考验全栈工程能力

上一个任务是纯前端的3D游戏,这第二个任务当然要换个方向,来彻底考验一下模型的全栈工程能力。

我让这三个模型开发一个“AI 绘图工具”,用户的需求很简单:输入自然语言描述,后端调用大模型生成 draw.io 格式的图表XML,然后前端把这个 draw.io 开源编辑器嵌入进去,用户可以直接在线编辑和修改生成的图表。

这个任务可不简单,它同时考验模型对 draw.io 开源代码的理解、后端AI调用链路的设计、前端复杂组件的集成,以及最重要的——整体产品设计的合理性。为了方便测试,我直接在提示词里把API Key提供给了AI,省去了AI自己去配置环境变量的步骤。

GLM-5.3 成品效果:产品级体验,深度融合

先来看看 GLM-5.3 的效果。

整个页面设计很有科技感,左侧是AI对话框,右侧是画布编辑器,布局清晰合理。产品引导做得也很到位,直接告诉你“可以用一句话画出专业图表”,还贴心地给出了几个示例类型。

我尝试让AI帮我画出 DeepSeek Harness 的架构图。在生成过程中,你可以实时看到AI深度思考和生成XML代码的过程,右侧的画布还会显示一个炫酷的Loading动画,这种实时反馈感非常棒。

生成完成后,右侧立刻就渲染出了完整的架构图,分层清晰,而且完美保留了 draw.io 原本的元素编辑能力,可以直接拖拽、修改,就像在用原版 draw.io 一样。

更强的是,它居然支持连续对话修改。比如我说“帮我把 DeepSeek Harness Core 这里变成红色”,AI 就能精准定位到对应的元素并修改样式,右侧画布实时更新,这种交互体验,简直是产品级的!

整体效果非常不错,图片导出功能也能正常使用。而且你会发现 GLM-5.3 把 draw.io 的编辑能力深度融合进了自己设计的界面中,看起来就像一个完整的产品,而不是生硬地嵌入了一个第三方组件,这点很难得。

DeepSeek V4 Pro 成品效果:核心功能勉强实现,但用户体验欠佳

再来看看 DeepSeek V4 Pro 的表现。

打开界面,右侧画布竟然是一片空白,只有一个大大的Loading图标?而且左下角的提示文字还出现了溢出,这前端表现,DeepSeek V4 Pro 确实有点拉胯了。

AI生成图表的功能倒还是可以正常使用的,但是没有实时展示AI思考过程的能力,你只能傻等着它全部生成完了,才能看到结果,交互体验差了一大截。

最关键的是,DeepSeek V4 Pro 很明显是直接把 draw.io 整个嵌入到了前端页面中,没有做任何深度集成。这种感觉就像是硬生生把两个东西粘在一起,而不是巧妙地融合,跟 GLM 那种把 draw.io 能力自然融入自己界面中的做法差距明显。

Kimi K3 成品效果:前端不错,但后端稳定性是短板

最后看 Kimi K3。

Kimi K3 这次生成的界面布局跟 GLM 类似,也把 draw.io 自然融合到了项目中,整体界面风格非常Nice,看起来也挺舒服的。

AI生成图表的功能正常,同样支持连续对话修改,这说明Kimi在前端交互设计上还是下了功夫的。

但是,我发现它的后端逻辑明显没做好提示词约束和工具校验,有时候AI生成的内容会直接翻车,把一大段XML源码直接糊在界面上,而不是渲染成图形,这可就尴尬了。

整体来看,Kimi K3 的前端设计能力跟 GLM-5.3 旗鼓相当,但在后端稳定性上却明显差了一截,还需要打磨。

实战 2 对比:GLM-5.3 依旧领先

在这个全栈绘图工具的任务里,GLM-5.3 的综合表现依然是最好的,无论是界面设计、AI深度思考的实时展示、连续对话修改,还是 draw.io 的深度融合,每一个环节都处理得非常到位,给人一种完整产品的体验。

Kimi K3 的前端设计能力很强,但可惜后端逻辑偶尔会翻车,影响了整体的用户体验。

DeepSeek V4 Pro 虽然也正常实现了核心功能,但是界面粗糙,组件集成方式生硬,用户体验感最差。

五、我的真实感受和成本分析

跑完这两个横跨纯前端3D游戏和全栈AI应用的实战项目,我的感受还是很深的。

很明显,即使是在 DeepSeek Harness 这个可以算是 DeepSeek 的“角色专武”主场环境下,GLM-5.3 的表现依然非常出色。这两个项目覆盖了完全不同的技术方向,但 GLM-5.3 在任务理解、代码生成质量、产品设计意识这几个维度上都明显领先,它的自主思考和纠错能力给我留下了深刻印象。

下面聊聊大家最关心的成本问题,猜猜我这次测试到底花了多少钱呢?

由于 GLM-5.3 我用的是编码套餐,不太好直接统计实际消耗金额,所以我只能拿积分来算了。两个项目累计消耗了 1151 积分,我订的是Pro套餐(538元/月),每周额度是6万积分,算下来这次的消耗只占了周额度不到2%,折算成钱,连3块钱都不到。这性价比,真是高到离谱。

Kimi K3 那边,我的套餐过期了,新的又没抢到,所以是直接用 API Key 接入,总共消耗了31.07元;而涨价之后的 DeepSeek V4 Pro 消耗了13.99元。

单从我这次实际花销来看,GLM-5.3 按照套餐计算,性价比是最高的。一周6万积分,足够你随便跑,根据我这次测试这种复杂任务的消耗情况,做几十个小项目应该是不成问题的。

在开源世界里,GLM-5.3 目前可以说是编程能力的天花板。智谱在发布文章中还提到,Hugging Face 之前遭遇安全攻击的时候,Anthropic 的 Mythos 模型只面向约150家大型机构提供服务,更多的中小企业和开源项目在最需要帮助的时候,反而用不上最强的防御工具。当攻击能力在扩散,防御能力就不能只掌握在少数人手中。GLM-5.3 的开源给所有人提供了一把防御的盾牌,这件事情本身的意义,可能比单纯的跑分高下更重要。

六、最后哔哔几句

这次横评下来,我对国产大模型的编程能力真是越来越有信心了。GLM-5.3、Kimi K3、DeepSeek V4 Pro 这几家打得不可开交,作为用户,我们真的是渔翁得利,有了更多更强的选择。

当然,每个模型都有它的长处和短板,选哪个,最终还是得看你的具体需求和预算。但从我的测试来看,如果你追求代码质量、产品设计和高性价比,GLM-5.3 绝对是目前一个非常值得深入尝试的选手。

如果没有这么多API额度,可以选择硅基流动的API,任选大模型,免费16元调用额度,免费上亿token!

© 版权声明
THE END
喜欢就支持一下吧
点赞10 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容