paperswithcode.com/sota/multi-task-language-understanding-on-mmlu
MM
MMLU
大规模多任务语言理解基准
立即开始了解更多
什么是 MMLU?
MMLU(大规模多任务语言理解)是一个广泛使用的基准测试,用于评估语言模型在多种任务上的表现。该页面汇集了最新的研究成果和代码实现,展示了各模型在MMLU上的排名和得分。用户可以通过该平台了解当前最先进的模型性能,并获取相关论文和代码链接,便于深入研究和复现实验。页面定期更新,确保信息的时效性。
4.1
评分
免费增值
定价模式
1+
平台
4.9k
收藏
优点
- Regular updates
- Simple setup process
缺点
- Feature set may be limited
- Support response times vary
多维度评分
4.2/ 5.0
⚡
功能完整性
3.8
🚀
性能速度
4.1
✨
易用性
4.4
💰
性价比
4.1
🎧
客户支持
4.2
🔒
隐私安全
4.6
核心能力
免费版
API接口
网页端
同类工具对比
| 功能 | MMLU | PubMedQA | MMBench | Frontier |
|---|---|---|---|---|
| 评分 | 4.1 | 4.4 | 4.8 | 4.5 |
| 定价模式 | 免费增值 | 免费增值 | 免费增值 | 免费增值 |
| 起价 | Free / Paid | Free / Paid | Free / Paid | Free / Paid |
| API | ✓ | — | — | — |
| 免费版 | ✓ | — | — | — |
| 移动端 | — | — | — | — |
适用人群
R
Researchers
Specialized analysis tools
1.7k 人使用
T
Teams
Collaborative AI workflows
2.2k 人使用
H
Hobbyists
Exploring AI capabilities
444 人使用
支持平台
网页版 ↗
Windows 暂不支持
Mac 暂不支持
iPhone/iPad 暂不支持
安卓 暂不支持
华为 暂不支持
Linux 暂不支持
支持语言
English
常见问题
Most tools offer free tiers or trial periods.