LLM Evaluation & Benchmark Engineering
LLM Benchmark Pass@k & Token Evaluator
Calculate Pass@k accuracy metrics for code generation and reasoning benchmarks (HumanEval / GSM8K), total API evaluation cost, and sample size confidence limits.
Total Generated Samples
820 Generations
Total Evaluation Cost
$5.88 USD
Confidence Margin
± 3.2%