A large-scale benchmark that evaluates AI agents' tool-use competency across 36 real MCP servers using a reproducible D…
A large-scale benchmark that evaluates AI agents' tool-use competency across 36 real MCP servers using a reproducible Docker sandbox and LLM-as-judge scoring.
AniGG-Eth
mcp
free