τ-bench (Tau-Bench)
github.com
评测语言 Agent 在真实场景中与模拟用户多轮对话、调用工具完成任务能力的基准。
开源ClaudeGPT
GitHub ★ 1,457被推荐 1 次
适合做什么
适合 Agent 开发者、模型评测研究者用来测试和对比模型在航空、零售等场景的工具调用与对话能力。
标签与属性
同类推荐
模型测评 / 排行榜
模型测评 / 排行榜评测语言 Agent 在真实场景中与模拟用户多轮对话、调用工具完成任务能力的基准。
适合 Agent 开发者、模型评测研究者用来测试和对比模型在航空、零售等场景的工具调用与对话能力。
模型测评 / 排行榜
模型测评 / 排行榜