跳到正文
评测来源

TapTap Maker Benchmark

TapTap Maker / 编程 · 在真实游戏引擎里用 Lua 写出能跑起来的功能。分数由引擎执行判定,不用另一个模型打分。

官方评测
在 Autojourney News 中参与排名
证据预算3.6%
上游数据时间待核实
最近成功同步尚未开始采集

它测什么,怎么测

只取官方 main_board 的 L2 通过率;成本、速度、Held-out 和分类分不再次投票。同一基础模型按固定推理档位优先级选代表行,选择不看分数。

如何使用这份证据

编程与设计预算中的 3.6%;固定引擎和 L2 指标。

评测局限与数据署名

单引擎、单语言,不能推广到其他技术栈;不同模型可能使用不同 agent 驱动;闭源 harness 不能逐题复算。

数据许可:官方公开结果;公开再展示保留官方署名,完整再分发授权仍以易玩/TapTap 条款为准

成绩由 TapTap Maker 发布,原始分数与 Autojourney News 共识分使用不同尺度,不能直接相加。