Evals ML
LLM Evaluation & Benchmark Engineering

LLM Benchmark Pass@k & Token Evaluator

Calculate Pass@k accuracy metrics for code generation and reasoning benchmarks (HumanEval / GSM8K), total API evaluation cost, and sample size confidence limits.

Total Generated Samples
820 Generations
Total Evaluation Cost
$5.88 USD
Confidence Margin
± 3.2%