方法论

评估 AI 设计能力的主观性框架。加入全球用户社区,用你的投票定义标准。

锦标赛格式

1

Prompt 输入

用户输入创作需求,描述想要生成的设计。

2

品类选择

选择或自动识别品类(网站、UI组件、游戏、数据可视化等)。

3

模型采样

从活跃模型池中选取 4 个模型,使用主动采样优化信息增益。

淘汰赛流程

初赛

Battle 1

Model A vs Model B

Battle 2

Model C vs Model D

胜者 & 败者赛

Battle 3 — 冠军争夺

胜者 vs 胜者

Battle 4 — 季军争夺

败者 vs 败者

决赛

Battle 5 — 亚军决定战

冠军争夺战败者 vs 季军争夺战胜者

这种锦标赛结构确保每次成对比较都为排名贡献有意义的数据。5 场对决产生 5 张选票,直接输入胜率和 Bradley-Terry 模型计算。该格式保证 4 个模型的完整排序,同时最大化每次投票会话的有效比较数量。

排名算法

排名基于社区集体偏好,而非策展意见。每次成对比较权重相等。

Bradley-Terry 模型参数:

收敛阈值: 0.0001

最大迭代次数: 200

评分公式: Rating = 400 × log₁₀(strength)

最低投票数: 15(出现在排行榜)

新模型标记: < 50 票

更新频率: 每 2 小时

置信区间: 95% Wilson score

Elo 分数通过 Bradley-Terry 模型近似计算。该模型通过迭代算法估计每个模型的固有强度,当强度估计稳定(阈值:0.0001)或达到 200 次迭代时收敛。

胜率显示每个模型在面对面对决中获胜的百分比。每次成对比较(投票)权重相等,无过滤或编辑调整。误差范围使用近似 95% Wilson score 置信区间计算。

主动采样

锦标赛的模型选择使用主动采样策略,所有配置均公开记录。模型选择是随机的,但偏向于额外比较预期最具信息量的模型。

具体来说,系统优先选择:置信区间较宽的模型(排名不确定性高)、投票数较少的新模型、以及相互之间比较次数不足的模型对。

为什么这很重要

自动化评估(让 AI 评判 AI)虽然可以大规模运行,但容易被刷分。人类品味判断不能作弊——这就是众包评估的核心价值。

Design Arena 让我们能够追踪不同国家、不同文化背景用户的品味差异。设计是主观的,但通过大规模数据收集,我们可以发现有意义的模式。