当大模型失去“品牌光环”,你还能分辨出谁更聪明吗?——我做了一个 AI 盲测竞技场

3 月 29 日
 lanweizhujiao

最近我在死磕 AI Agent 的评估技术,看了市面上五花八门的评测榜单,又去深入研究了各种复杂的 AI 辅助评估体系(比如让 GPT-4 当裁判)、RAGAS 等等。

但看来看去,总觉得心里缺点什么。

现在的模型评测痛点真的太明显了:

  1. 指标太冰冷:各种学术化的分数堆叠在一起,当模型真正面对普通用户的闲聊、吐槽或者是各种稀奇古怪的需求时,那些干瘪的指标根本体现不出哪个模型更有“人情味”和灵性。
  2. AI 当裁判的偏见:用强模型做评委( LLM-as-a-Judge )不仅贵,而且这些模型特别喜欢“给自己打高分”(也就是自我偏好),或者是哪个答案长就选哪个。
  3. 真实声音太少:其实最有效、最能反映用户诉求的评测,就是真实用户的“用脚投票”( RLHF 人类偏好数据),然而市面上能让普通人低门槛参与进来的开源趣味测评并不多。

所以,我索性自己动手糊了一个小项目:AI Evolution Arena ( AI 进化竞技场)

👉 体验地址在这里: https://arena.angrach.top/

简单来说,这是一个 大模型盲测与评测平台

它是怎么玩的?

我最初做这个项目的初衷真的就是为了 撕掉大模型的厂牌标签,回归到“回答内容本身”

它没有任何登录注册的门槛,即开即用。所有的流式渲染、打字机效果我都做了仔细的优化,只为给你最流畅的对阵体验。希望你能来玩一玩,哪怕只是偶尔遇到了什么无解的问题,顺手丢进竞技场,看看两个神秘模型谁能给你更好的启示。

平台刚上线,后续我还会把胜率排行榜( Leaderboard )慢慢完善起来。你的每一次投票,其实都在帮我们沉淀一份最真实、最宝贵的人类偏好数据。

4761 次点击
所在节点    推广
26 条回复
lightyisu
3 月 29 日
前端做得不错
Tink
3 月 29 日
我记得有一个类似的项目
wangtufly
3 月 30 日
要不搞个述职评审,毕竟模型互评去掉最高去掉最低取平均已经是很合理的方式了
Orchestraa
3 月 30 日
GPT4 过于古老的名字了 @livid ai 生成内容
nightlight9
3 月 30 日
有意思
Meursau1T
3 月 30 日
grok 得益于搜索能力,确实在这种测试中很容易拿分。尝试了几个问题,你竞技场的模型回答的都不如 grok 准确。刚刚跑去 arena 上看了下,grok 就只比 A/和 gemini 3.1 低。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1201937

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX