
Grok 4.6 es la nueva versión del modelo de SpaceXAI y centra su avance en la ejecución de tareas prolongadas, la programación y el trabajo con grandes volúmenes de información. No se trata de un modelo base de mayor tamaño, sino de una actualización de postentrenamiento sobre Grok 4.5.
El lanzamiento incorpora una ventana de contexto de 500.000 tokens, un nuevo nivel de esfuerzo de razonamiento llamado xhigh y disponibilidad inmediata a través de la API de xAI, Cursor y Grok Build. También puede utilizarse mediante OpenRouter, Vercel y Cloudflare.
Grok 4.6 amplía el contexto hasta 500.000 tokens y está orientado a agentes que mantienen una tarea durante muchos pasos, con acceso general mediante API, Cursor y Grok Build.
Una actualización centrada en el postentrenamiento
SpaceXAI mantuvo constante la base de Grok 4.5 y dedicó el trabajo adicional a una sesión de entrenamiento suplementaria más larga, nuevas trayectorias de ajuste supervisado y aprendizaje por refuerzo en entornos de agentes. El proceso incluyó datos generados por modelos sobre razonamiento y conceptos técnicos, material de ingeniería y una receta de optimización mejorada.
Grok 4.5 también se utilizó para regenerar trayectorias de ajuste supervisado en distintos niveles de razonamiento, entornos de agentes y áreas como STEM, ingeniería de software y trabajo documental. Los registros considerados problemáticos se filtraron mediante comprobaciones basadas en modelos antes de aplicar el aprendizaje por refuerzo.
Las pruebas internas de SpaceXAI señalan que, en recorridos más largos, Grok 4.6 realiza más comprobaciones y verificaciones de su trabajo antes de continuar. Esta observación pertenece al proveedor y no equivale a una medición independiente del comportamiento.
Contexto amplio, entrada de imágenes y acceso
El modelo admite entradas de texto e imagen, aunque genera únicamente texto. Su fecha de corte de conocimiento es el 1 de febrero de 2026 y no se ha comunicado su número de parámetros. El ajuste reasoning_effort ofrece los niveles bajo, medio, alto —el predeterminado— y xhigh.
La disponibilidad es general a través de la API como grok-4.6. Es el modelo predeterminado de Grok Build y está integrado en Cursor en todos sus planes. También puede enrutar solicitudes mediante OpenRouter, Vercel y Cloudflare. No hay una versión con pesos abiertos ni una vía de autoalojamiento, por lo que no está planteado para despliegues aislados de redes externas.
Precio y caché de contexto
Por debajo de 200.000 tokens de la petición, la tarifa es de 2 dólares por millón de tokens de entrada, 0,50 dólares por millón de tokens de entrada almacenada en caché y 6 dólares por millón de tokens de salida. Por encima de ese umbral, los precios suben a 4, 1 y 12 dólares, respectivamente.
Para aprovechar la caché, los equipos deben definir un prompt_cache_key o utilizar la cabecera x-grok-conv-id en Chat Completions. Sin ese identificador, las solicitudes pueden distribuirse entre servidores y perder accesos a la caché. Cursor y Grok Build ofrecen durante la primera semana el doble de uso incluido.
Resultados desiguales en las pruebas
Grok 4.6 obtiene 61 puntos en el Artificial Analysis Intelligence Index, cinco más que Grok 4.5 y la misma puntuación que GPT-5.6 Sol Max. En la tabla de lanzamiento aparece por delante en GDPval-AA v2, AA-Briefcase y Harvey LAB, aunque las dos primeras diferencias están dentro de los intervalos de confianza y deben considerarse empates estadísticos.
El rendimiento es menos favorable en varias pruebas de programación. DeepSWE v1.1 registra un 65,9 %, frente al 73 % de GPT-5.6 Sol Max, mientras que Terminal-Bench v3.0 alcanza el 26 %, por encima del 15,7 % de Grok 4.5 pero por detrás de los otros modelos incluidos. También obtiene un 69,9 % en CursorBench v3.2, un 61,3 % en FrontierCode v1.1 Extended y un 57,5 % en APEX-Agents.
Estas cifras proceden de la tabla de lanzamiento y no constituyen por sí solas un veredicto global. Además, el conjunto comparado no incluye Claude Opus 5, señalado en el material como líder actual de ese índice.
Qué puede aportar a los equipos
El contexto de 500.000 tokens permite abordar repositorios completos, migraciones, procesos de investigación y síntesis sobre grandes corpus documentales. La formación también apunta a la generación inicial de aplicaciones a partir de requisitos, la optimización de kernels para GPU, el diseño asistido por ordenador y tareas de análisis financiero o jurídico.
Los equipos pequeños pueden probarlo directamente desde Cursor y Grok Build sin construir un sistema de agentes. Para organizaciones de ingeniería de tamaño medio, la API incorpora autenticación mTLS y procesamiento por lotes y prioritario. En sectores regulados, el despliegue debería comenzar con un piloto antes de extenderse a cargas críticas.
Conclusión
Grok 4.6 apuesta por mejorar la continuidad de los agentes y el trabajo con contexto extenso mediante postentrenamiento, no por aumentar el tamaño de su modelo base. Su acceso amplio y la ventana de 500.000 tokens lo sitúan como una opción relevante para repositorios, documentos y flujos técnicos largos.
El balance, sin embargo, depende del uso: los resultados son sólidos en algunas pruebas de conocimiento y productividad, pero siguen mostrando pérdidas en benchmarks de programación frente a otros modelos. La ausencia de pesos abiertos y de autoalojamiento también limita su adopción en entornos que requieren control completo de la infraestructura.
Encuentra más IA en nuestra sección de IA o suscríbete a Guslok – Guías 100% en YouTube para más contenido.


