Loading...
AI排行榜
  • API 中转站比价
  • 官方 API 平台
  • 每日AI资讯
  • 最新AI项目
  • 关于我们
  • 广告合作
      • 未登录
        登录后即可体验更多功能
    • API 中转站比价
    • 官方 API 平台
    • 每日AI资讯
    • 最新AI项目
    • 关于我们
    • 广告合作
    未登录
    登录后即可体验更多功能

    AI模型评测

    共 15 篇网址
    AI写作工具AI图像工具AI视频工具AI办公工具AI聊天助手AI智能体AI编程工具AI开发平台AI设计工具AI音频工具AI搜索引擎AI学习网站AI训练模型AI模型评测AI内容检测AI提示指令AI副业工具其他工具
    排序
    发布更新浏览点赞
    MagicArena

    MagicArena

    MagicArena 是字节跳动推出的国内首个视觉生成大模型对战平台。用户输入文字,能调用不同模型(如 如 Midjourney、FLUX、可灵、海螺、即梦等)生成图片或视频,进行比较、投票。
    010
    AI模型评测
    AGI-Eval

    AGI-Eval

    AGI-Eval是上海交通大学、同济大学、华东师范大学、DataWhale等高校和机构合作发布的大模型评测社区,旨在打造公正、可信、科学、全面的评测生态,以“评测助力,让AI成为人类更好的伙伴”为使命。专门设计用于评估基础模型在人类认知和问题解决相关任务中的一般能力。
    010
    AI模型评测
    MMBench

    MMBench

    MMBench是多模态基准测试,由上海人工智能实验室、南洋理工大学、香港中文大学、新加坡国立大学和浙江大学的研究人员联合推出。MMBench推出一个综合评估流程,从感知到认知能力逐级细分评估,覆盖20项细粒度能力,从互联网与权威基准数据集采集约3000道单项选择题。
    010
    AI模型评测
    H2O EvalGPT

    H2O EvalGPT

    H2O EvalGPT 是 H2O.ai 用于评估和比较 LLM 大模型的开放工具,它提供了一个平台来了解模型在大量任务和基准测试中的性能。无论你是想使用大模型自动化工作流程或任务,H2O EvalGPT 都可以提供流行、开源、高性能大模型的详细排行榜,帮助你为项目选择最有效的模型完成具体任务。
    010
    AI模型评测
    HELM

    HELM

    HELM是由斯坦福大学推出的大模型评测体系,该评测方法主要包括场景、适配、指标三个模块,每次评测的运行都需要指定一个场景,一个适配模型的提示,以及一个或多个指标。
    010
    AI模型评测
    LLMEval3

    LLMEval3

    LLMEval是由复旦大学NLP实验室推出的大模型评测基准,最新的LLMEval-3聚焦于专业知识能力评测,涵盖哲学、经济学、法学、教育学、文学、历史学、理学、工学、农学、医学、军事学、管理学、艺术学等教育部划定的13个学科门类、50余个二级学科,共计约20W道标准生成式问答题目。
    010
    AI模型评测
    PubMedQA

    PubMedQA

    PubMedQA是专门用在生物医学研究问题回答的数据集。PubMedQA通过文献摘要回答“是/否/可能”形式的研究问题,例如“某种药物是否有效”。数据集包含1000个专家标注的问答实例、61200个未标注实例和211300个人工生成的问答对。
    010
    AI模型评测
    C-Eval

    C-Eval

    C-Eval是一个适用于大语言模型的多层次多学科中文评估套件,由上海交通大学、清华大学和爱丁堡大学研究人员在2023年5月份联合推出,包含了13948个多项选择题,涵盖了52个不同的学科和四个难度级别,用以评测大模型中文理解能力。
    010
    AI模型评测
    MMLU

    MMLU

    MMLU 全称 Massive Multitask Language Understanding,是一种针对大模型的语言理解能力的测评,是目前最著名的大模型语义理解测评之一,由UC Berkeley大学的研究人员在2020年9月推出。
    010
    AI模型评测
    Open LLM Leaderboard

    Open LLM Leaderboard

    Open LLM Leaderboard 是最大的大模型和数据集社区 HuggingFace 推出的开源大模型排行榜单,基于 Eleuther AI Language Model Evaluation Harness(Eleuther AI语言模型评估框架)封装。
    010
    AI模型评测
    CMMLU

    CMMLU

    CMMLU是综合性的中文评估基准,专门用在评估语言模型在中文语境下的知识和推理能力,涵盖从基础学科到高级专业水平的67个主题。包括需要计算和推理的自然科学,需要知识的人文科学和社会科学,及需要生活常识的中国驾驶规则等。
    010
    AI模型评测
    SuperCLUE

    SuperCLUE

    SuperCLUE 是针对中文大模型的综合性评测基准,能全面评估模型在多个维度上的性能表现。SuperCLUE 通过多轮对话、客观题测试等多种方式,从语言理解与生成、知识应用、专业技能、环境适应与安全性等四大能力象限的 12 项基础能力进行评估。
    010
    AI模型评测
    LMArena

    LMArena

    LMArena是加州大学伯克利分校推出的创新AI模型评估平台,基于让用户对不同AI模型的回答进行匿名投票,衡量模型的表现。用户输入问题后,平台提供两个模型的回答,用户根据偏好选择更优答案,投票结果直接塑造公共排行榜。
    010
    AI模型评测
    FlagEval

    FlagEval

    FlagEval(天秤)是北京智源人工智能研究院(BAAI)推出的科学、公正、开放的大模型评测体系及开放平台,为研究人员提供全面评估基础模型及训练算法性能的工具和方法。FlagEval采用“能力-任务-指标”三维评测框架,从多个维度对大模型的认知能力进行评估,涵盖对话、问答、情感分析等多种应用场景,提供超过22个数据集和8万道评测题目。
    010
    AI模型评测
    OpenCompass

    OpenCompass

    OpenCompass是上海人工智能实验室(上海AI实验室)于2023年8月正式推出的大模型开放评测体系,通过完整开源可复现的评测框架,支持大语言模型、多模态模型各类模型的一站式评测,并定期公布评测结果榜单。
    010
    AI模型评测
    没有了
    AI排行榜
    OneNav 一为导航主题,集网址、资源、资讯于一体的 WordPress 导航主题,简约优雅的设计风格,全面的前端用户功能,简单的模块化配置,欢迎您的体验

    友链申请 免责声明 广告合作 关于我们

    扫码加QQ群AI排行榜
    扫码加QQ群
    扫码加微信AI排行榜
    扫码加微信
    Copyright © 2026 AI排行榜 冀ICP备2026033332号 由 OneNav 强力驱动 
    反馈
    让我们一起共建文明社区!您的反馈至关重要!
    网址
    网址文章软件书籍
      ↵ENTER↓↑NAV