New to Claude Skills? Learn how to install them →

Benchmarking skills

Free agent skills tagged benchmarking, ready to install into any SKILL.md-compatible agent.

Chat Performance Testing

microsoft

Benchmark and validate chat UI performance in VS Code.

Developer ToolsintermediateNode · Shell188.6k repo

Comparable Company Analysis

anthropics

Create institutional-grade financial analyses in Excel.

Businessintermediate34.2k repo

NeMo Evaluator SDK

davila7

Enterprise-grade LLM benchmarking across 100+ tasks.

AI & AgentsintermediatePython · Shell30.2k repo

Benchmark Methodology

affaan-m

Score competitors consistently across nine dimensions.

Businessintermediate239.3k repo

LLM Evaluation Harness

davila7

Benchmark LLMs across 60+ academic tasks.

AI & AgentsintermediatePython · Shell30.2k repo

RAG-Perf

nvidia

Benchmark performance of NVIDIA RAG Blueprint servers.

Developer ToolsintermediatePython · Shell2.8k repo

RAG Evaluation

nvidia

Evaluate retrieval-augmented generation benchmarks efficiently.

AI & AgentsintermediatePython · Shell2.8k repo

Evals

danielmiessler

An assertion-first framework for AI evaluations.

AI & AgentsintermediateNode · Shell18k repo

Code Model Evaluation

davila7

Benchmark code generation models across multiple tasks.

Developer ToolsintermediatePython · Shell30.2k repo

V3 Performance Optimization

ruvnet

Boost performance of claude-flow v3 significantly.

Developer ToolsadvancedNode · Shell67.6k repo

Competitive Platform Analysis

affaan-m

Define your competitive landscape before benchmarking.

Businessintermediate239.3k repo

DOCA GPUNetIO ib_write_bw

nvidia

Measure sustained RDMA WRITE bandwidth with GPU support.

Developer Toolsintermediate2.8k repo

DOCA GPUNetIO ib_write_lat

nvidia

Measure GPU kernel RDMA WRITE latency accurately.

Developer Toolsintermediate2.8k repo

OpenClaw Test Performance

openclaw

Benchmark and optimize OpenClaw test runtime effectively.

Developer ToolsintermediateShell385.8k repo

Microbenchmarking

dotnet

Efficiently write and run .NET microbenchmarks with BDN.

Developer Toolsintermediate5.1k repo

DOCA Bench

nvidia

Measure DOCA library performance reliably and reproducibly.

Developer Toolsintermediate2.8k repo

DOCA Flow Perf

nvidia

Measure the performance of DOCA Flow pipelines accurately.

Developer Toolsintermediate2.8k repo
H

HoloHub Application Lifecycle

nvidia

Streamline your HoloHub app development process.

Developer Toolsintermediate2.8k repo

CodeGraph Quality Audit

colbymchenry

Benchmark CodeGraph's impact on agent performance.

Developer ToolsintermediateShell65.8k repo
A

Add Language

colbymchenry

Integrate new languages into CodeGraph's extraction pipeline.

Developer ToolsintermediateNode · Shell65.8k repo

Agent Evaluation

sickn33

Benchmark and assess LLM agents effectively.

AI & Agentsintermediate44.7k repo
P

PinchTab Optimization Loop

pinchtab

Benchmark and validate your PinchTab agent setup.

Developer ToolsintermediateShell10k repo

Benchmark Harness

mims-harvard

Enhance ToolUniverse tools with systematic evaluation.

Developer ToolsintermediatePython · Shell1.6k repo

Diligence Meeting Prep

anthropics

Streamline your due diligence meeting preparations.

Businessintermediate34.2k repo