NextJS
Next.js Evals results and methodology for AI coding agents.
Official benchmark from Vercel measuring AI model performance on Next.js code generation and migration tasks. Evaluates success rate, execution time, token usage, and quality improvements.
Results
1Factory Droid (GPT-5.2)
66%
2Factory Droid (Claude Opus 4.5)
56%
3Factory Droid (Claude Sonnet 4.5)
50%
4Factory Droid (Gemini 3 Pro)
46%
5Claude Code (Claude Opus 4.5)
42%
6Cursor (Claude Sonnet 4.5)
38%
Last updated: December 2025
Methodology
| Category | Description |
|---|---|
| Code Generation | Creating Next.js components, pages, and API routes |
| Migration | Upgrading from Pages Router to App Router |
| Best Practices | Following Next.js patterns and conventions |
| TypeScript | Proper type safety and inference |
Scoring metrics:
- Success Rate - Percentage of tasks completed correctly
- Execution Time - Time to complete tasks
- Token Usage - Efficiency of model responses
- Quality Score - Code quality and best practices