NextJS

Next.js Evals results and methodology for AI coding agents.

Official benchmark from Vercel measuring AI model performance on Next.js code generation and migration tasks. Evaluates success rate, execution time, token usage, and quality improvements.

Results

1Factory Droid (GPT-5.2)
66%
2Factory Droid (Claude Opus 4.5)
56%
3Factory Droid (Claude Sonnet 4.5)
50%
4Factory Droid (Gemini 3 Pro)
46%
5Claude Code (Claude Opus 4.5)
42%
6Cursor (Claude Sonnet 4.5)
38%

Last updated: December 2025

Methodology

CategoryDescription
Code GenerationCreating Next.js components, pages, and API routes
MigrationUpgrading from Pages Router to App Router
Best PracticesFollowing Next.js patterns and conventions
TypeScriptProper type safety and inference

Scoring metrics:

  • Success Rate - Percentage of tasks completed correctly
  • Execution Time - Time to complete tasks
  • Token Usage - Efficiency of model responses
  • Quality Score - Code quality and best practices
Next.js Evals
View live results and methodology
Next.js Evals