Files
ModelTest20260714/xiaohongshu/post.md
T

1.8 KiB
Raw Blame History

最强 6 大模型从 0 开始开发游戏大横评!

说实话,这次测试真的带给了我不小的惊喜,我原本以为 Kimi K3 接近 Opus4.8,实测结果:居然可以介于 Opus4.8 到 Fable5 之间。

六个模型,同一份 PRD,各自独立做一款像素游戏《童话·蜜糖村》:地图必须用 Tiled Map Editor 规划绘制,素材必须用 Aseprite,引擎用 Phaser 38-bit 的 BGM要用 WebAudio 现场编写渲染,没有现成素材可以使用。地图、美术、对话、BGM、完成度全部实机对比。

和 Fable 5 比,K3 确实差一些。Fable 的画面建模更加接近星露谷那种风格,K3 的画面饱和度太高,细节和 Fable 也有一定的差距。

但超过 Opus 4.8也是确实可以看得出来。K3 的广场有向日葵、邮箱、长椅和路灯,湖畔有野餐垫,NPC 对话有头像有台词。龟爷爷那句「这湖水啊,映着的从来不是天上的云」,是六个模型里写得最惊艳的一句话。

同一场测试里,Grok 和 GLM 5.2 交的还是草稿,K3 已经站进了 Fable 和 Opus 中间。

GPT 5.6 Sol 这次有明显失误:人物一移动就消失,实机稳定复现。画面本身不算差,但这个 bug 直接把它踢出第一梯队。

Grok 和 GLM 5.2 地图大面积留白,角色是方块脸。同一份 PRD,前面几家交的是游戏,这两家交的是作业,明显不是同一个时代的能力。

我的实测排名:Fable 5 High Kimi K3 Opus 4.8 Xhigh GPT 5.6 SolGrok 和 GLM 5.2 垫底。

六个游戏全部实时在线,可以直接试玩:

modeltesthub.zacharyzhang.com

项目在 GitHub 全开源,入口在页面上。

你觉得 K3 这个位置合理吗?评论区聊。

#AI测评 #KimiK3 #大模型 #游戏开发 #AI编程 #像素游戏 #Phaser #Claude #OpenAI #GLM #Grok