El ecosistema chino de modelos de frontera sigue demostrando una aceleración implacable en el campo de la programación agéntica y la ingeniería de software. Tras la irrupción de Kimi K3 de Moonshot y GLM-5.3 de Zhipu AI, la compañía StepFun ha publicado formalmente los resultados de evaluación de su nueva arquitectura: Step 5 Preview (High).
Las métricas, obtenidas tanto en evaluaciones públicas como en bancos de pruebas internos rigurosos, posicionan a Step 5 Preview como uno de los modelos más sólidos del panorama internacional en tareas de desarrollo de software, entornos de terminal interactivos y razonamiento profesional.
A continuación desglosamos todos los resultados oficiales obtenidos en DeepSWE v1.1, StepCodeBench, ProgramBench, Terminal-Bench v4, Agents' Last Exam (ALE-CLI) y GDPval-AA v2.1, enfrentándolos cara a cara con la competencia directa china y los gigantes occidentales GPT-6 Astra y Claude Opus 5.
Benchmark Oficial: Step 5 Preview Frente a la Frontera Internacional
Fuente: StepFun Technical Evaluation Report (2026). Evaluaciones en DeepSWE v1.1, StepCodeBench, ProgramBench, Terminal-Bench v4, Agents' Last Exam y GDPval-AA v2.1.
Los datos confirmados por el equipo de investigación de StepFun revelan una competencia feroz en la cumbre de la codificación autónoma:
| Benchmark / Evaluación | Step 5 Preview (High) | Kimi K3 (Max) | GLM-5.3 (Max) | GPT-6 Astra (Max) | Claude Opus 5 (Max) |
|---|---|---|---|---|---|
| DeepSWE v1.1 (Ingeniería de Software Real) | 67,7% | 67,5% | 66,9% | 74,1% | 74,0% |
| StepCodeBench (Codificación Compleja) | 49,0% | 43,9% | 40,2% | 61,0% | 63,9% |
| ProgramBench (Síntesis de Programas) | 80,5% | 77,8% | 72,0% | 85,4% | 82,3% |
| Terminal-Bench v4 (Control de CLI y Entornos) | 33,3% | 12,6% | 41,9% | 57,9% | 52,3% |
| Agents' Last Exam (ALE-CLI) (Agentes Extremos) | 29,5% | 27,6% | 28,6% | - | - |
| GDPval-AA v2.1 (Evaluación Económica y Profesional) | 1566 | 1524 | 1645 | - | - |
Las Cuatro Claves del Rendimiento de Step 5 Preview
1. DeepSWE v1.1: A la Caza de GPT-6 Astra y Claude Opus 5
En el benchmark de referencia para la resolución de incidencias reales en repositorios de GitHub (DeepSWE v1.1), Step 5 Preview alcanza un 67,7%.
- Supera por dos décimas a Kimi K3 (67,5%) y casi un punto entero a GLM-5.3 (66,9%), coronándose como el modelo chino más efectivo resolviendo issues de ingeniería de software de extremo a extremo.
- Aunque los gigantes occidentales GPT-6 Astra (74,1%) y Claude Opus 5 (74,0%) mantienen una ventaja de aproximadamente seis puntos porcentuales, la reducción de la brecha confirma que las técnicas de aprendizaje por refuerzo orientadas a SWE aplicadas por StepFun son plenamente competitivas a escala global.
2. Dominio Contundente en StepCodeBench y ProgramBench
Donde Step 5 Preview abre una brecha clara respecto a sus rivales directos es en la generación y comprensión algorítmica:
- En StepCodeBench, firma un 49,0%, dejando atrás a Kimi K3 con 43,9% y a GLM-5.3 con 40,2% (una ventaja neta de casi 9 puntos).
- En ProgramBench, supera la barrera del 80% alcanzando un 80,5%, frente al 77,8% de Kimi K3 y el 72,0% de GLM-5.3.
Esta solvencia se traduce en una menor tasa de alucinación sintáctica cuando se generan funciones complejas, algoritmos de grafos o migraciones de bases de datos.
3. Terminal-Bench v4: Resurrección frente a Kimi K3 pero por Detrás de GLM-5.3
Uno de los puntos débiles históricos de varios modelos orientados a chat ha sido la ejecución de comandos bash en bucle cerrado:
- Kimi K3 sufre notablemente en este apartado con apenas un 12,6%.
- Step 5 Preview da un salto cuantitativo hasta el 33,3%, casi triplicando la capacidad de Kimi para interactuar con sistemas de archivos, depurar compilaciones en vivo y gestionar procesos de consola.
- Sin embargo, GLM-5.3 de Zhipu AI retiene el liderazgo asiático en terminal con un 41,9%, demostrando una mayor especialización en flujos de terminal puro, mientras que los líderes occidentales se sitúan en el rango del 52% al 58%.
4. Agents' Last Exam (ALE-CLI): El Examen de Agentes Más Complejo
En Agents' Last Exam (ALE-CLI), una prueba diseñada específicamente para evaluar la capacidad de persistencia, recuperación ante errores y planificación a largo plazo en consolas de comandos sin intervención humana:
- Step 5 Preview logra la mejor marca con un 29,5%, superando el 28,6% de GLM-5.3 y el 27,6% de Kimi K3.
- Este dato valida la solidez de su bucle de reflexión interna, evitando bucles infinitos en ejecución de comandos.
El Triunvirato Tecnológico Chino: Comparativa de Especialización
| Modelo | Laboratorio | Punto Fuerte Principal | Punto Débil | Rol Óptimo |
|---|---|---|---|---|
| Step 5 Preview (High) | StepFun | Síntesis algorítmica (80,5%) y SWE (67,7%) | Control de terminal inferior a GLM | Generación de código y resolución de bugs complejos |
| GLM-5.3 (Max) | Zhipu AI | Dominio de terminal CLI (41,9%) y GDPval (1645) | Menor precisión en ProgramBench (72,0%) | Operaciones de DevOps, pipelines CI/CD y automatización |
| Kimi K3 (Max) | Moonshot | Razonamiento matemático y contexto ultra-largo | Control de terminal muy pobre (12,6%) | Análisis de documentos extensos y arquitectura general |
Preguntas Frecuentes sobre StepFun Step 5 Preview
¿Qué es StepFun y qué modelos desarrolla?
StepFun (Jieyue Xingchen) es una de las empresas de inteligencia artificial más destacadas de Asia, fundada por veteranos de la computación cognitiva. Desarrolla la familia de modelos multimodales y de lenguaje Step, con especial foco en ventanas de contexto extremas, comprensión de vídeo y programación agéntica de frontera.
¿Cómo se compara Step 5 Preview frente a Claude Opus 5 en programación?
En tareas de SWE en repositorios reales (DeepSWE), Claude Opus 5 mantiene una ventaja del 74,0% frente al 67,7% de Step 5 Preview. En codificación general (StepCodeBench), Opus 5 alcanza el 63,9% frente al 49,0% de Step 5. No obstante, Step 5 Preview ofrece un rendimiento suficiente para sustituir a modelos de primera línea en entornos con restricciones de coste o soberanía de datos.
¿Estará disponible el modelo con licencia abierta?
Al igual que las versiones preliminares anteriores de StepFun, Step 5 Preview se distribuye inicialmente en modalidad propietaria a través de su plataforma de API y entorno de investigación, evaluándose posteriormente la publicación de pesos destilados para la comunidad científica.