aiknow
τ-bench (Tau-Bench)

τ-bench (Tau-Bench)

github.com

评测语言 Agent 在真实场景中与模拟用户多轮对话、调用工具完成任务能力的基准。

开源ClaudeGPT
GitHub ★ 1,457被推荐 1 次

适合做什么

适合 Agent 开发者、模型评测研究者用来测试和对比模型在航空、零售等场景的工具调用与对话能力。

标签与属性

价格
支持模型

同类推荐

模型测评 / 排行榜

MTEB

★ 3,451

多语言多模态的 Embedding 与检索系统评测基准,含排行榜与 Python 工具库。

开源多模态可自部署本地模型命令行
github.com1 处推荐
模型测评 / 排行榜

众包式 AI 模型评测平台,通过用户盲测投票生成 LLM、图像与代码模型的公开排行榜。

网页
arena.ai2 处推荐
模型测评 / 排行榜

评测大模型与编程 Agent 解决真实 GitHub 软件工程问题的权威基准与官方排行榜。

网页
swebench.com2 处推荐
数据集 / 数据标注

Gorilla

★ 13,042

伯克利开源项目,让大模型准确调用 API 与工具,并维护函数调用排行榜 BFCL。

开源有 API可自部署网页
github.com1 处推荐
模型测评 / 排行榜

开源、全面的大模型评测开放平台,提供 LLM 与多模态榜单、评测集社区和竞技场。

开源中文界面多模态GPTClaude
opencompass.org.cn1 处推荐
模型测评 / 排行榜

独立评测 AI 模型与 API 提供商的基准平台,覆盖质量、价格、速度与延迟等指标。

网页
artificialanalysis.ai3 处推荐
τ-bench (Tau-Bench) - 模型测评 / 排行榜 - aiknow