方法论
评估 AI 设计能力的主观性框架。加入全球用户社区,用你的投票定义标准。
锦标赛格式
Prompt 输入
用户输入创作需求,描述想要生成的设计。
品类选择
选择或自动识别品类(网站、UI组件、游戏、数据可视化等)。
模型采样
从活跃模型池中选取 4 个模型,使用主动采样优化信息增益。
淘汰赛流程
Battle 1
Model A vs Model B
Battle 2
Model C vs Model D
Battle 3 — 冠军争夺
胜者 vs 胜者
Battle 4 — 季军争夺
败者 vs 败者
Battle 5 — 亚军决定战
冠军争夺战败者 vs 季军争夺战胜者
这种锦标赛结构确保每次成对比较都为排名贡献有意义的数据。5 场对决产生 5 张选票,直接输入胜率和 Bradley-Terry 模型计算。该格式保证 4 个模型的完整排序,同时最大化每次投票会话的有效比较数量。
排名算法
排名基于社区集体偏好,而非策展意见。每次成对比较权重相等。
Bradley-Terry 模型参数:
收敛阈值: 0.0001
最大迭代次数: 200
评分公式: Rating = 400 × log₁₀(strength)
最低投票数: 15(出现在排行榜)
新模型标记: < 50 票
更新频率: 每 2 小时
置信区间: 95% Wilson score
Elo 分数通过 Bradley-Terry 模型近似计算。该模型通过迭代算法估计每个模型的固有强度,当强度估计稳定(阈值:0.0001)或达到 200 次迭代时收敛。
胜率显示每个模型在面对面对决中获胜的百分比。每次成对比较(投票)权重相等,无过滤或编辑调整。误差范围使用近似 95% Wilson score 置信区间计算。
主动采样
锦标赛的模型选择使用主动采样策略,所有配置均公开记录。模型选择是随机的,但偏向于额外比较预期最具信息量的模型。
具体来说,系统优先选择:置信区间较宽的模型(排名不确定性高)、投票数较少的新模型、以及相互之间比较次数不足的模型对。
为什么这很重要
自动化评估(让 AI 评判 AI)虽然可以大规模运行,但容易被刷分。人类品味判断不能作弊——这就是众包评估的核心价值。
Design Arena 让我们能够追踪不同国家、不同文化背景用户的品味差异。设计是主观的,但通过大规模数据收集,我们可以发现有意义的模式。