Performance skills
Free performance skills for AI coding agents, part of our developer tools collection.
30 skills
Customize Clocks
nvidia
Control CPU, GPU, and EMC clock settings for Jetson devices.
CuTile Autotuning
nvidia
Optimize CuTile kernels with automated tuning techniques.
DeepStream Profiling
nvidia
Efficiently profile and tune DeepStream pipelines.
RAG-Perf
nvidia
Benchmark performance of NVIDIA RAG Blueprint servers.
Memory Tuning
nvidia
Optimize GPU memory usage during training runs.
CUDA Graphs
nvidia
Optimize GPU performance with CUDA graph capture.
Omniverse USD Performance Tuning
nvidia
Optimize USD performance for better loading and rendering.
Jetson Inference Memory Tuning
nvidia
Optimize memory settings for LLM/VLM on NVIDIA Jetson.
Megatron Bridge Resiliency
nvidia
Enhance fault tolerance and performance in distributed training.
Parallelism Strategy Selection
nvidia
Optimize parallelism for Megatron Bridge models effectively.
Accelerated Computing cuDF
nvidia
Efficient GPU DataFrame operations for pandas users.
CPU Offloading
nvidia
Optimize memory usage by offloading CPU tasks in Megatron Bridge.
Activation Recompute
nvidia
Optimize GPU memory usage with activation recompute.
NeMo Evaluator Plugin
nvidia
Evaluate models and datasets efficiently with NeMo.
Jetson Memory Optimizer
nvidia
Optimize DRAM usage for Jetson devices.
MoE Dispatcher Selection
nvidia
Optimize your MoE token dispatcher for peak performance.
cuTile Kernel Performance Optimization
nvidia
Optimize cuTile kernel performance iteratively and systematically.
Hierarchical Context Parallel
nvidia
Optimize Megatron-Bridge for hierarchical context parallelism.
MoE VLM Training
nvidia
Optimize your MoE VLM training with practical guidance.
DOCA Flow Tune
nvidia
Optimize and analyze your DOCA Flow pipelines effectively.
DOCA Flow DPA Perf
nvidia
Measure DPA-offloaded Flow performance on supported hardware.
DOCA Flow Perf
nvidia
Measure the performance of DOCA Flow pipelines accurately.
DOCA GPUNetIO ib_write_lat
nvidia
Measure GPU kernel RDMA WRITE latency accurately.
DOCA Bench
nvidia
Measure DOCA library performance reliably and reproducibly.
