New to Claude Skills? Learn how to install them →

Benchmarking skills

Free agent skills tagged benchmarking, ready to install into any SKILL.md-compatible agent.

Chat Performance Testing

microsoft

Benchmark and validate chat UI performance in VS Code.

Developer ToolsintermediateNode · Shell188.6k repo

Comparable Company Analysis

anthropics

Create institutional-grade financial analyses in Excel.

Businessintermediate34.2k repo

RAG-Perf

nvidia

Benchmark performance of NVIDIA RAG Blueprint servers.

Developer ToolsintermediatePython · Shell2.8k repo

RAG Evaluation

nvidia

Evaluate retrieval-augmented generation benchmarks efficiently.

AI & AgentsintermediatePython · Shell2.8k repo

Code Model Evaluation

davila7

Benchmark code generation models across multiple tasks.

Developer ToolsintermediatePython · Shell30.2k repo

V3 Performance Optimization

ruvnet

Boost performance of claude-flow v3 significantly.

Developer ToolsadvancedNode · Shell67.6k repo

DOCA Flow Perf

nvidia

Measure the performance of DOCA Flow pipelines accurately.

Developer Toolsintermediate2.8k repo

DOCA GPUNetIO ib_write_lat

nvidia

Measure GPU kernel RDMA WRITE latency accurately.

Developer Toolsintermediate2.8k repo

DOCA Bench

nvidia

Measure DOCA library performance reliably and reproducibly.

Developer Toolsintermediate2.8k repo
H

HoloHub Application Lifecycle

nvidia

Streamline your HoloHub app development process.

Developer Toolsintermediate2.8k repo
A

Add Language

colbymchenry

Integrate new languages into CodeGraph's extraction pipeline.

Developer ToolsintermediateNode · Shell65.8k repo

CodeGraph Quality Audit

colbymchenry

Benchmark CodeGraph's impact on agent performance.

Developer ToolsintermediateShell65.8k repo
P

PinchTab Optimization Loop

pinchtab

Benchmark and validate your PinchTab agent setup.

Developer ToolsintermediateShell10k repo

Benchmark Harness

mims-harvard

Enhance ToolUniverse tools with systematic evaluation.

Developer ToolsintermediatePython · Shell1.6k repo

Diligence Meeting Prep

anthropics

Streamline your due diligence meeting preparations.

Businessintermediate34.2k repo

Go Benchmarking

samber

Measure and optimize Go application performance effectively.

Developer ToolsintermediateShell2.9k repo

Benchmark Due Diligence

daymade

Uncover the truth behind inflated success claims.

Businessintermediate1.3k repo

V3 Performance Engineer

ruvnet

Optimize and validate performance for AI agents.

Developer ToolsadvancedNode67.6k repo

Cost Benchmark

ruvnet

Verify and measure AI cost performance effectively.

Developer ToolsintermediateNode · Shell67.6k repo

Cost Trend

ruvnet

Monitor performance drift in AI model benchmarks.

Developer ToolsintermediateNode · Shell67.6k repo

HuggingFace Best Model Finder

huggingface

Find the top AI models for your specific tasks and devices.

Developer ToolsintermediateShell10.9k repo

Benchmark Sandbox

vercel

Run Vercel plugin evaluations in isolated environments.

Developer ToolsintermediateNode · Shell249 repo
P

Performance Optimization

rtk-ai

Enhance RTK CLI performance with systematic analysis.

Developer ToolsintermediateShell75.5k repo

Spec-Driven Implementation Evaluation

tech-leads-club

Score your implementation against PRD specifications.

Developer ToolsintermediateShell5k repo