AI 产品的成败,往往在选模型那一刻就已决定。我们用覆盖文本、图像、网页生成的真实产品场景测试,帮你在花时间打磨产品之前,先找到能力、效果、成本都最适配的那个模型。
评分说明
榜单分数仅统计由系统发起的评测任务。社区用户自行发起的评测结果仅用于个人调试与对比,不计入总分与榜单。
基础、进阶、困难 基础、进阶、困难 分别代表三个难度层级任务的加权得分。综合 = 基础×30% + 进阶×40% + 困难×30%,满分 100 分,60 分为及格线。
我们采用 LLM-as-a-Judge 方法进行评分,每个测试用例按多个独立维度分别评分后加权汇总。通过证据锚定、难度分层、双轨评审等策略消除常见偏见,确保评分可解释、可追溯。
精准的场景化检索
放弃大而全的综合评分,直接按你的业务场景(如:代码生成、商业设计、数据分析)找测试案例,快速定位模型在特定维度的真实能力。
直观的输出对比
冰冷的数字不如真实的生成结果。我们直接展示各个模型面对同一个 Prompt 时的真实输出,让你「眼见为实」,建立自己的选型判断。
发掘极致性价比
最聪明的模型往往也是最贵的。通过对比,你可以找到那些在特定场景下表现足够好,但 API 成本更低、速度更快的「经济适用型」方案。
四大核心测评体系
XSCT-VG
图像生成 (Vision Generation)
涵盖商业设计、人物生成、场景创作、风格控制等 14 个细分场景,考察模型的画面控制与审美下限。
XSCT-L
文字生成 (Language)
覆盖创意写作、代码生成、客服对话、数据分析等 22 个实用场景,检验模型的逻辑思维与指令遵循能力。
XSCT-W
网页生成 (Web Generation)
专注前端代码生成,包含落地页、仪表盘、小游戏、动画效果等 10 个测试项,所见即所得的代码评估。
XSCT-VU
视觉理解 (Vision Understanding)
多模态理解能力测试,包含图表解析、UI草图转代码、图像信息提取等,正在紧密筹备中。
在线网址:https://xsct.ai/
GitHub地址:https://github.com/itshen/XSCT_Bench_Dataset



评论0+