Grok 4.7 me parece uno de los lanzamientos más interesantes de SpaceXAI hasta la fecha. Y no precisamente porque llegue con otro puñado de benchmarks para presumir de puntuaciones, sino porque empieza a demostrar que Grok quiere competir en algo bastante más importante: hacer trabajo real.
Con esta generación, el foco está especialmente puesto en la programación, el razonamiento prolongado, las tareas de conocimiento y los agentes de IA. Grok sigue teniendo esa personalidad que siempre lo ha diferenciado dentro del mercado, pero Grok 4.7 parece perseguir un objetivo bastante más ambicioso que ser simplemente un chatbot llamativo.
El modelo fue lanzado el 21 de septiembre de 2026 y mantiene buena parte de las especificaciones comerciales de Grok 4.6: una ventana de contexto de 500.000 tokens y un precio base de 2 dólares por millón de tokens de entrada y 6 dólares por millón de salida para prompts por debajo de 200.000 tokens. A partir de ese umbral, las tarifas suben a 4 y 12 dólares respectivamente.
Lo verdaderamente interesante está debajo de esas cifras.
SpaceXAI asegura haber utilizado un modelo base mayor y un proceso de aprendizaje por refuerzo más prolongado, poniendo especial énfasis en tareas complejas que pueden requerir mucho tiempo de ejecución.
Y para mí es precisamente ahí donde empieza la historia de Grok 4.7.
Qué es Grok 4.7 y por qué esta versión es importante
Grok 4.7 es una nueva generación del modelo de inteligencia artificial de SpaceXAI orientada especialmente a mejorar la programación avanzada, el razonamiento y la ejecución de tareas complejas de conocimiento.
Sobre el papel podría parecer una evolución incremental de Grok 4.6. Comparten una ventana de contexto de 500.000 tokens y la misma estructura básica de precios. Sin embargo, las primeras evaluaciones independientes apuntan a diferencias apreciables en determinadas tareas: Grok 4.7 obtiene 46 puntos frente a los 44 de Grok 4.6 en el Intelligence Index de Artificial Analysis y 56 frente a 47 en su Coding Agent Index.
Pero reducir el lanzamiento a esos dos números sería quedarse en la superficie.
En mi caso, lo que más me llama la atención es el cambio de dirección que representa. Grok ya no parece querer competir solamente por responder mejor una pregunta. El objetivo se acerca cada vez más a conseguir que el modelo razone, utilice herramientas y mantenga una tarea durante mucho más tiempo.
Eso cambia bastante lo que debemos exigirle a una IA.
Resolver un problema de programación en un benchmark es una cosa. Trabajar sobre un proyecto durante horas, inspeccionar archivos, ejecutar herramientas, descubrir que algo ha salido mal, volver atrás y continuar sin perder el objetivo original es otra muy distinta.
Grok 4.7 parece construido pensando cada vez más en ese segundo escenario.
Qué novedades trae Grok 4.7
Las novedades más relevantes no consisten únicamente en darle al modelo más conocimiento. SpaceXAI ha cambiado tanto la base utilizada como el entrenamiento posterior.
Según la información publicada alrededor del lanzamiento, Grok 4.7 utiliza un modelo base más grande que Grok 4.6 y un periodo de aprendizaje por refuerzo más largo, orientado especialmente a tareas complejas de larga duración.
Esto es importante porque el entrenamiento base y el aprendizaje por refuerzo cumplen papeles diferentes. No basta con que el modelo haya absorbido cantidades enormes de información: también tiene que aprender a comportarse correctamente cuando debe resolver un problema mediante muchos pasos.
Más capacidad para programación y tareas complejas
La programación es uno de los campos donde más claramente quiere destacar Grok 4.7.
Las evaluaciones publicadas por el propio proveedor muestran mejoras frente a Grok 4.6 en pruebas como CursorBench, DeepSWE y Terminal-Bench. Conviene poner una advertencia delante de esos resultados: buena parte de las cifras iniciales proceden de SpaceXAI y no todas han sido reproducidas independientemente.
Las mediciones externas disponibles son más interesantes precisamente por eso.
Artificial Analysis sitúa a Grok 4.7 en 56 puntos en su Coding Agent Index, frente a los 47 de Grok 4.6 en sus respectivos entornos nativos.
La diferencia es considerablemente mayor que los dos puntos que separan a ambos modelos en el índice general.
Y eso nos da una primera pista: Grok 4.7 puede resultar bastante más interesante en tareas concretas de programación de lo que su mejora en inteligencia general sugiere a primera vista.
Razonamiento más prolongado para trabajos que requieren muchos pasos
Este es probablemente uno de los cambios que más me interesan.
Cada vez importa menos que una IA responda espectacularmente bien a una pregunta aislada y más que pueda permanecer trabajando durante varios minutos —o mucho más— sin descarrilar.
En una tarea compleja, el modelo puede tener que leer documentación, modificar código, comprobar el resultado, utilizar una herramienta, interpretar un error y volver a intentarlo.
El reto deja de ser:
“¿Conoce la respuesta?”
Y pasa a ser:
“¿Puede llegar hasta la respuesta correcta sin que yo tenga que llevarlo de la mano?”
Si el entrenamiento prolongado que SpaceXAI describe consigue trasladarse realmente a este tipo de situaciones, para mí sería bastante más importante que ganar unos cuantos puntos adicionales en un benchmark general.
Grok Bot y la apuesta por los agentes de IA
Aquí aparece otra pieza importante: el entorno agéntico.
Cuando hablamos de agentes, el modelo deja de ser únicamente un generador de texto. Tiene que decidir qué hacer, utilizar herramientas, observar los resultados y continuar trabajando.
Por eso un modelo excelente como chatbot no tiene por qué ser automáticamente un excelente agente.
El salto importante consiste en pasar de:
prompt → respuesta
a algo más parecido a:
objetivo → planificación → herramienta → resultado → comprobación → corrección → siguiente acción.
Para mí, entrenar y evaluar Grok pensando en este tipo de flujo es una de las partes más interesantes de su evolución.
Grok 4.7 vs Grok 4.6: cuáles son las diferencias
A primera vista, Grok 4.7 y Grok 4.6 se parecen bastante.
Los dos ofrecen una ventana de contexto de 500.000 tokens y comparten una estructura de precios de 2 dólares por millón de tokens de entrada y 6 por millón de salida hasta el umbral de 200.000 tokens de prompt.
Las diferencias aparecen cuando miramos el entrenamiento y el rendimiento.
| Característica | Grok 4.7 | Grok 4.6 |
|---|---|---|
| Contexto | 500.000 tokens | 500.000 tokens |
| Precio base entrada | $2 / millón | $2 / millón |
| Precio base salida | $6 / millón | $6 / millón |
| Intelligence Index | 46 | 44 |
| Coding Agent Index | 56 | 47 |
| AA-Briefcase | 1.657 Elo | 1.546 Elo |
Las cifras corresponden a las evaluaciones y condiciones recogidas por Artificial Analysis y resumidas en los referentes analizados; no deben interpretarse como una garantía de idéntico rendimiento en cualquier carga de trabajo.
Rendimiento y razonamiento
La subida de 44 a 46 puntos en el Intelligence Index puede parecer pequeña.
No la interpretaría de manera aislada.
Cuando los modelos se encuentran ya en la zona alta de determinadas evaluaciones, conseguir mejoras adicionales puede resultar cada vez más difícil. Pero, al mismo tiempo, dos puntos tampoco justifican por sí solos afirmar que la experiencia cotidiana vaya a cambiar radicalmente.
Por eso prefiero observar dónde aparecen las mejoras.
Y programación agéntica y trabajo profesional son dos áreas especialmente interesantes.
Programación y capacidades agénticas
El salto de 47 a 56 en el Coding Agent Index es mucho más llamativo que la diferencia observada en inteligencia general. AA-Briefcase también pasa de 1.546 Elo en Grok 4.6 a 1.657 en Grok 4.7.
Esto refuerza una de mis impresiones sobre el lanzamiento: quizá la pregunta equivocada sea “¿cuánto más inteligente es Grok 4.7?”
La pregunta más útil puede ser:
“¿En qué trabajos se ha vuelto realmente mejor?”
Velocidad y eficiencia
Grok 4.7 mantiene la estructura de precio de su predecesor y dispone además de variantes orientadas a mayor velocidad. Las fuentes analizadas describen una opción rápida que aproximadamente duplica la velocidad de salida a cambio de duplicar también el precio.
Pero velocidad y eficiencia tampoco son exactamente lo mismo.
Un modelo puede generar tokens muy deprisa y, aun así, consumir tantos que la tarea completa termine siendo más cara o lenta de lo esperado.
Y este detalle va a resultar importante cuando hablemos del precio.
Grok 4.7 para programación: uno de los grandes saltos de esta generación
Si tuviera que elegir una de las áreas que merece seguir de cerca en Grok 4.7, sería la programación.
No solamente porque mejore sus resultados, sino porque los modelos de programación están evolucionando desde el clásico asistente que completa código hacia sistemas capaces de encargarse de partes cada vez mayores del ciclo de desarrollo.
Cómo rinde Grok 4.7 programando
Los resultados iniciales son prometedores, aunque conviene diferenciar los datos del proveedor de las evaluaciones independientes.
Entre las cifras comunicadas por el proveedor aparecen un 46,3 % en CursorBench 4.0 y un 71 % en DeepSWE v1.1 bajo las condiciones utilizadas en su evaluación. En Terminal-Bench 4.0, el proveedor comunicó un 38 %.
No trataría estas cifras como verdades universales. Un benchmark nos dice cómo se comportó un modelo en unas condiciones determinadas, no cómo funcionará automáticamente sobre nuestro repositorio.
Por eso me parece más interesante combinar las pruebas con proyectos reales.
Qué cambia cuando una IA tiene que trabajar durante varios minutos
Aquí está, para mí, el verdadero examen.
Cuando utilizo un modelo para resolver una duda puntual, puedo comprobar su respuesta inmediatamente. En cambio, cuando le entrego una tarea compleja, necesito confiar en una cadena de decisiones mucho más larga.
Tiene que entender el proyecto, localizar archivos relevantes, modificar código, ejecutar pruebas y reaccionar ante lo que encuentre.
Cuantos más pasos añadimos, más oportunidades existen de que una pequeña equivocación inicial termine desviando completamente el resultado.
Por eso cada vez valoro menos una respuesta espectacular aislada y más la capacidad de trabajar durante mucho tiempo sin perder el contexto ni necesitar supervisión constante.
Herramientas, contexto y capacidad para corregir errores
La ventana de contexto de 500.000 tokens proporciona a Grok 4.7 bastante espacio para trabajar con información extensa.
Pero tener contexto disponible no significa utilizarlo correctamente.
En tareas reales quiero comprobar tres cosas:
- si encuentra la información relevante dentro de ese contexto;
- si recuerda las decisiones importantes a medida que avanza;
- si detecta cuándo una acción anterior ha sido incorrecta.
La tercera es especialmente importante.
Un agente que nunca se equivoca sería fantástico, pero no es una expectativa realista. Un agente que detecta el error y consigue recuperarse solo puede resultar muchísimo más útil.
Grok 4.7 y los agentes de IA: por qué Grok Bot puede ser importante
Los agentes están convirtiéndose en uno de los principales campos de batalla entre los grandes laboratorios de inteligencia artificial.
La razón es sencilla: un chatbot nos ayuda a trabajar; un buen agente puede empezar a completar partes del trabajo.
Esa diferencia tiene enormes implicaciones.
De responder prompts a completar tareas
Pensemos en una investigación.
Un chatbot tradicional puede resumir los documentos que le proporcionemos.
Un agente, en cambio, puede tener que localizar información, decidir qué fuentes consultar, comparar datos, identificar contradicciones, preparar un documento y revisar el resultado.
La calidad de cada respuesta sigue importando, pero ahora aparece una nueva variable: la continuidad del trabajo.
Y creo que este es uno de los terrenos donde Grok 4.7 quiere hacerse un hueco.
El reto de mantener el razonamiento durante muchos pasos
Los errores se acumulan.
Si una tarea requiere veinte decisiones consecutivas y el modelo interpreta mal la quinta, todo lo que ocurra después puede quedar condicionado.
Por eso el entrenamiento en tareas de mayor duración que SpaceXAI describe me parece más interesante que un simple incremento de tamaño.
La autonomía útil no consiste en dejar al modelo hacer cosas sin control. Consiste en que pueda avanzar más lejos antes de necesitar una intervención.
Cuándo importa más la autonomía que una respuesta perfecta
Para determinadas consultas, quiero la mejor respuesta posible.
Para otras tareas, prefiero un modelo ligeramente menos brillante en una pregunta aislada si consigue completar correctamente veinte pasos consecutivos.
Ahí cambia la definición de “mejor IA”.
Programación, investigación, análisis documental y automatización son buenos ejemplos. El resultado final depende de toda la trayectoria, no de un único prompt.
Benchmarks de Grok 4.7: cuánto ha mejorado realmente
Los benchmarks son útiles. El problema aparece cuando intentamos convertir una tabla en una respuesta universal sobre cuál es el mejor modelo.
Grok 4.7 lo demuestra bastante bien porque sus resultados cambian según lo que midamos.
Resultados en Artificial Analysis
En el Intelligence Index v4.3.2 citado por los referentes, Grok 4.7 obtiene 46 puntos con esfuerzo xhigh. Grok 4.6 queda en 44.
Pero al compararlo con GPT-5.6 Sol encontramos resultados muy diferentes dependiendo de la prueba.
Por ejemplo, los datos recogidos por OrcaRouter muestran a Grok 4.7 por delante en AutomationBench-AA y en evaluaciones de entregables profesionales como AA-Briefcase y GDPval-AA, mientras GPT-5.6 Sol obtiene mejores resultados en esa comparación en Terminal-Bench, razonamiento complejo y contexto largo.
Eso es bastante más informativo que mirar únicamente la puntuación agregada.
Rendimiento en benchmarks de programación y agentes
En el Coding Agent Index independiente recogido por OrcaRouter, Grok 4.7 alcanza 56 puntos frente a los 47 de Grok 4.6.
AA-Briefcase cuenta una historia parecida: 1.657 Elo para Grok 4.7 frente a 1.546 de su predecesor en las configuraciones citadas.
Es precisamente esta disparidad entre evaluaciones lo que me resulta interesante.
El modelo no parece mejorar exactamente igual en todo. Hay áreas donde el salto resulta mucho más visible.
Por qué una puntuación más alta no siempre significa un modelo mejor para ti
Personalmente, no elegiría un modelo únicamente por su posición en un benchmark.
Los benchmarks sirven para reducir incertidumbre, comparar capacidades bajo condiciones relativamente controladas y detectar tendencias. Pero nuestro trabajo real rara vez se parece exactamente a una prueba estandarizada.
Si voy a utilizar Grok 4.7 para programar, quiero probarlo con mi código.
Si lo quiero para investigar, necesito saber cómo se comporta con mis fuentes.
Y si quiero utilizarlo como agente, me interesa descubrir cuánto puede avanzar antes de necesitar que yo intervenga.
La pregunta final no es:
“¿Qué puntuación tiene?”
Sino:
“¿Cuánto trabajo útil consigue terminar?”
Precio de Grok 4.7: cuánto cuesta usarlo
El precio es uno de los argumentos más atractivos sobre el papel.
Grok 4.7 mantiene un coste base de 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida para solicitudes por debajo de 200.000 tokens de prompt. Al superar ese nivel, la estructura citada pasa a 4 dólares de entrada y 12 de salida.
Precio de entrada y salida
Esto permite que Grok 4.7 presente un precio nominal agresivo frente a determinados modelos de frontera.
Por ejemplo, la comparación publicada por OrcaRouter utiliza para GPT-5.6 Sol unas tarifas de 4 dólares por millón de tokens de entrada y 20 dólares por millón de salida, señalando además que esas tarifas de Sol son promocionales en el periodo analizado.
Si nos quedamos aquí, Grok parece claramente más barato.
Pero nos falta una parte importante.
Cómo queda frente a otros modelos de IA
Comparar modelos únicamente mediante precio por millón de tokens es parecido a comparar coches mirando exclusivamente el precio del litro de combustible.
Necesitamos saber cuánto consume cada uno para completar el trayecto.
OrcaRouter recoge una diferencia especialmente ilustrativa: en las ejecuciones de Artificial Analysis citadas, Grok 4.7 produjo alrededor de 81.000 tokens de salida por tarea frente a unos 29.000 de GPT-5.6 Sol.
El token de Grok puede ser considerablemente más barato, pero eso no implica que cada trabajo terminado vaya a ser proporcionalmente más económico.
El precio por token no cuenta toda la historia
Esta es una de las partes que más tendría en cuenta si fuese a utilizar Grok 4.7 de forma intensiva.
Para mí:
coste real ≠ precio por token.
El coste efectivo también depende de:
- cuántos tokens necesita;
- cuánto tiempo razona;
- cuántos intentos realiza;
- cuántas veces falla;
- cuánto tengo que supervisarlo;
- y cuánto trabajo útil termina.
Un modelo que cuesta el doble por token pero resuelve una tarea correctamente en el primer intento puede terminar saliendo más barato que otro que necesita tres intentos y diez minutos de revisión humana.
En agentes, esta diferencia puede ser todavía mayor.
El tiempo humano también cuesta dinero.
Velocidad de Grok 4.7: ¿realmente es el doble de rápido?
Aquí conviene tener cuidado con los titulares.
Las fuentes analizadas describen una variante rápida de Grok 4.7 que aproximadamente duplica la velocidad de salida a cambio de aproximadamente duplicar también el precio.
Por tanto, hablar simplemente de “Grok 4.7 es el doble de rápido” puede inducir a error si no especificamos qué variante estamos comparando y en qué condiciones.
Además, la velocidad de generación no es sinónimo de velocidad para completar una tarea.
Un modelo puede generar 200 tokens por segundo y tardar más en terminar si produce una cantidad enorme de tokens. Otro puede generar más despacio pero llegar antes al resultado.
Por eso, para evaluar velocidad en situaciones reales, yo miraría:
latencia inicial + velocidad de generación + tokens utilizados + número de pasos + reintentos.
Ese conjunto se acerca bastante más a la experiencia que realmente tendremos.
Grok 4.7 vs GPT-5.6 Sol: diferencias principales
Esta es una comparación especialmente interesante porque ambos modelos pueden estar muy cerca en algunas evaluaciones y bastante separados en otras.
No hay una única métrica que resuma correctamente todos los casos de uso.
Programación y agentes
Los datos recogidos en las fuentes muestran resultados mixtos.
Grok 4.7 destaca en algunas evaluaciones de automatización y entregables profesionales, mientras GPT-5.6 Sol presenta mejores resultados en la comparación citada para Terminal-Bench 4.0.
Eso hace que el caso de uso sea fundamental.
Un benchmark de programación científica, uno de terminal y uno de automatización no están midiendo exactamente la misma habilidad.
Razonamiento y tareas de conocimiento
En el Intelligence Index citado, Grok 4.7 obtiene 46 puntos y GPT-5.6 Sol 47 bajo los niveles de esfuerzo comparados.
Pero la diferencia agregada de un punto oculta una dispersión bastante mayor.
En los datos recogidos por OrcaRouter, Sol obtiene mejores resultados en varias pruebas de razonamiento complejo y contexto largo, mientras Grok 4.7 destaca en otras relacionadas con automatización, entregables profesionales y la métrica de conocimiento/honestidad incluida en esa comparación.
Por eso evitaría concluir que uno es universalmente “más inteligente” basándome en un único número.
Velocidad, consumo de tokens y coste
Grok 4.7 tiene una ventaja clara en precio nominal por token bajo las tarifas comparadas: 2/6 dólares frente a 4/20 para GPT-5.6 Sol.
Sin embargo, la medición citada también atribuye a Grok 4.7 bastante más consumo de tokens de salida por tarea.
Y ahí volvemos al mismo punto: precio y coste no son sinónimos.
Para decidir entre ambos probaría exactamente la carga de trabajo que vaya a utilizar y mediría coste por resultado satisfactorio, no únicamente coste por millón de tokens.
¿Merece la pena Grok 4.7?
La respuesta depende mucho más del trabajo que queramos hacer que de una clasificación general.
Si ya utilizas Grok 4.6, Grok 4.7 resulta especialmente interesante porque mantiene la misma estructura básica de precios y contexto mientras mejora en varias evaluaciones de programación y trabajo profesional.
Para programación y agentes, el salto merece especialmente atención.
Para tareas con muchísimo contexto, también conviene tener en cuenta que sus 500.000 tokens pueden quedar por debajo de alternativas con ventanas mayores. En la comparación utilizada anteriormente, GPT-5.6 Sol dispone de una ventana de aproximadamente 1,05 millones de tokens.
Y si el criterio principal es el precio, tampoco me quedaría solamente con la tarifa de API.
Yo haría una pequeña prueba con 20 o 30 tareas representativas de mi trabajo y mediría cuatro cosas:
tasa de éxito, tiempo total, tokens consumidos e intervenciones humanas.
Esa prueba probablemente me diría bastante más que diez tablas de benchmarks.
En mi caso, precisamente eso es lo que más quiero comprobar con Grok 4.7: cómo responde programando durante periodos prolongados, investigando información, manejando contextos grandes o ejecutando tareas autónomas en las que tenga que darse cuenta de que se ha equivocado y corregirse.
Porque ahí es donde realmente se decide si estamos delante de un chatbot más inteligente o de una herramienta capaz de asumir una parte mayor del trabajo.
Grok 4.7 muestra hacia dónde se dirige la carrera de la IA
Grok 4.7 no me parece interesante simplemente porque consiga mejores resultados que Grok 4.6.
Lo interesante es dónde parece estar mejorando.
Programación, trabajo de conocimiento, razonamiento prolongado y agentes son precisamente algunas de las áreas que determinarán cuánto valor práctico pueden generar los próximos modelos.
OpenAI, Anthropic, Google y SpaceXAI están empujando cada vez más hacia sistemas que no solo respondan preguntas, sino que utilicen herramientas y ejecuten tareas completas.
Eso también cambia la manera en que deberíamos compararlos.
Ya no basta con preguntar cuál tiene el benchmark más alto.
Hay que preguntar cuál termina antes el trabajo, cuál comete menos errores, cuál necesita menos supervisión y cuánto cuesta obtener un resultado que realmente podamos utilizar.
Para mí, Grok 4.7 es otra señal clara de esa transición.
La siguiente carrera de la IA no consiste únicamente en construir el modelo más inteligente. Consiste en conseguir que esa inteligencia sea rápida, económica, fiable y suficientemente autónoma para hacer trabajo real.
Dudas de la comunidad
¿Qué es Grok 4.7?
Grok 4.7 es una generación del modelo de inteligencia artificial de SpaceXAI presentada el 21 de septiembre de 2026. Está especialmente orientada a mejorar programación, razonamiento y tareas complejas de conocimiento y agentes.
¿Cuándo se lanzó Grok 4.7?
Las fuentes analizadas sitúan su lanzamiento el 21 de septiembre de 2026.
¿Qué diferencias hay entre Grok 4.7 y Grok 4.6?
Mantienen una ventana de contexto y estructura de precios similares, pero Grok 4.7 utiliza un modelo base mayor y un entrenamiento por refuerzo más prolongado según la información publicada sobre el lanzamiento. En evaluaciones independientes citadas, pasa de 44 a 46 en Intelligence Index y de 47 a 56 en Coding Agent Index frente a Grok 4.6.
¿Cuánto cuesta Grok 4.7?
El precio base recogido en las fuentes es de 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida por debajo de 200.000 tokens de entrada. Al superar ese umbral se citan tarifas de 4 y 12 dólares respectivamente.
¿Grok 4.7 es bueno para programar?
Las primeras evaluaciones apuntan a una mejora importante frente a Grok 4.6 en programación agéntica. En el Coding Agent Index citado, Grok 4.7 obtiene 56 puntos frente a 47 de Grok 4.6. El rendimiento sobre un proyecto concreto puede diferir, por lo que conviene probarlo con tareas representativas del flujo de trabajo real.
¿Qué es Grok Bot?
Grok Bot forma parte del enfoque agéntico alrededor de Grok: la idea relevante para este tipo de sistemas es que el modelo no se limite a generar respuestas, sino que pueda trabajar dentro de flujos donde utiliza herramientas y ejecuta varios pasos. Las fuentes analizadas aquí ofrecen más detalle cuantitativo sobre los benchmarks agénticos que sobre una especificación exhaustiva de Grok Bot, por lo que evitaría atribuirle funciones concretas adicionales sin documentación específica.
¿Qué ventana de contexto tiene Grok 4.7?
Las fuentes consultadas sitúan la ventana de contexto de Grok 4.7 en 500.000 tokens, igual que Grok 4.6.
¿Grok 4.7 es más rápido que Grok 4.6?
No conviene resumirlo simplemente de esa forma. Europa Press recoge que el modelo mantiene la velocidad de ejecución de su predecesor, mientras las fuentes técnicas analizadas describen además una variante rápida de Grok 4.7 que aproximadamente duplica la velocidad de salida a cambio de duplicar el precio. Hay que distinguir la variante y condiciones concretas antes de comparar.
¿En qué benchmarks destaca Grok 4.7?
Entre las evaluaciones citadas aparecen mejoras destacables en programación agéntica y trabajo profesional. Los referentes recogen 56 puntos en el Coding Agent Index y 1.657 Elo en AA-Briefcase, aunque los resultados cambian considerablemente según la prueba utilizada.
¿Qué diferencias hay entre Grok 4.7 y GPT-5.6 Sol?
Grok 4.7 presenta un precio nominal por token inferior bajo las tarifas comparadas y obtiene mejores resultados en algunas evaluaciones de automatización y entregables profesionales. GPT-5.6 Sol obtiene mejores resultados en otras pruebas de razonamiento, agentes de terminal y contexto largo, además de ofrecer una ventana de contexto mayor en la comparación analizada. Por eso la elección depende especialmente de la carga de trabajo concreta.
Opinión Personal
Grok 4.7 me parece uno de los movimientos más interesantes que hemos visto últimamente en la carrera de la inteligencia artificial. No tanto porque consiga unos puntos más en determinados benchmarks, sino porque refleja bastante bien hacia dónde está evolucionando el sector.
Personalmente, cada vez me interesa menos saber qué modelo ocupa el primer puesto de una clasificación durante unas semanas. Lo que realmente quiero comprobar es cuánto trabajo puede hacer por mí antes de necesitar mi intervención.
Y creo que ahí estará la verdadera prueba para Grok 4.7.
Si consigue mantener el contexto durante tareas largas, programar durante horas, utilizar herramientas correctamente, detectar sus propios errores y continuar trabajando sin necesitar supervisión constante, el salto frente a generaciones anteriores será mucho más importante que cualquier pequeña diferencia en una tabla de resultados.
También me parece especialmente interesante la batalla del precio. Tener modelos cada vez más potentes está muy bien, pero para utilizarlos diariamente también necesitamos que sean rápidos y económicamente sostenibles. Eso sí, no me dejaría convencer únicamente por un precio por token más bajo: lo que realmente importa es cuánto cuesta conseguir un trabajo correctamente terminado.
Por eso creo que Grok 4.7 merece atención, especialmente para programación, agentes y tareas profesionales complejas. Ahora queda comprobar hasta qué punto todas esas mejoras sobre el papel se mantienen cuando dejamos los benchmarks y empezamos a trabajar con proyectos reales.
¿Qué opinas tú de Grok 4.7? ¿Crees que puede competir de tú a tú con los modelos de OpenAI, Anthropic y Google? Y si ya lo has probado, cuéntame tu experiencia en los comentarios: qué te ha sorprendido, dónde te ha fallado y para qué tareas lo estás utilizando. Me interesa especialmente conocer cómo se está comportando fuera de los benchmarks.





