Files
ModelTest20260714/xiaohongshu/post.md
T

28 lines
1.8 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 最强 6 大模型从 0 开始开发游戏大横评!
说实话,这次测试真的带给了我不小的惊喜,我原本以为 Kimi K3 接近 Opus4.8,实测结果:居然可以介于 Opus4.8 到 Fable5 之间。
六个模型,同一份 PRD,各自独立做一款像素游戏《童话·蜜糖村》:地图必须用 Tiled Map Editor 规划绘制,素材必须用 Aseprite,引擎用 Phaser 38-bit 的 BGM要用 WebAudio 现场编写渲染,没有现成素材可以使用。地图、美术、对话、BGM、完成度全部实机对比。
和 Fable 5 比,K3 确实差一些。Fable 的画面建模更加接近星露谷那种风格,K3 的画面饱和度太高,细节和 Fable 也有一定的差距。
但超过 Opus 4.8也是确实可以看得出来。K3 的广场有向日葵、邮箱、长椅和路灯,湖畔有野餐垫,NPC 对话有头像有台词。龟爷爷那句「这湖水啊,映着的从来不是天上的云」,是六个模型里写得最惊艳的一句话。
同一场测试里,Grok 和 GLM 5.2 交的还是草稿,K3 已经站进了 Fable 和 Opus 中间。
GPT 5.6 Sol 这次有明显失误:人物一移动就消失,实机稳定复现。画面本身不算差,但这个 bug 直接把它踢出第一梯队。
Grok 和 GLM 5.2 地图大面积留白,角色是方块脸。同一份 PRD,前面几家交的是游戏,这两家交的是作业,明显不是同一个时代的能力。
我的实测排名:Fable 5 High Kimi K3 Opus 4.8 Xhigh GPT 5.6 SolGrok 和 GLM 5.2 垫底。
六个游戏全部实时在线,可以直接试玩:
modeltesthub.zacharyzhang.com
项目在 GitHub 全开源,入口在页面上。
你觉得 K3 这个位置合理吗?评论区聊。
#AI测评 #KimiK3 #大模型 #游戏开发 #AI编程 #像素游戏 #Phaser #Claude #OpenAI #GLM #Grok