温馨提醒

如果文章内容或图片资源失效,请留言反馈,我们会及时处理,谢谢

本文最后更新于2025年8月14日,已超过 180天没有更新

LiveBench简介:

LLM的基准,在设计时考虑了测试集污染和客观评估。它具有以下属性:

LiveBench通过定期发布新问题来限制潜在的污染。

每个问题都有可验证的、客观的事实真相答案,从而消除了对法学硕士法官的需要。

LiveBench目前包含7个类别的21个不同任务,随着时间的推移,我们将发布新的、更难的任务。

我们定期更新问题,以便基准每6个月完全刷新一次。以前版本的一些问题可以在这里找到。最新版本是LiveBench-2025-05-30.这个版本包括一个新的代理编码任务,其中模型必须在真实的开发环境中运行,以解决现实世界的存储库问题。

为了进一步减少污染,我们推迟公开最新更新中的问题。LiveBench-2025-04-02、LiveBench-2025-04-25和LiveBench-2026-05-30包含约300个新问题,因此目前LiveBench中约30%的问题尚未公开发布。

在线网址:https://livebench.ai/#/

GitHub地址:https://github.com/LiveBench/LiveBench/

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系客服QQ3387285338进行处理。