Connect with us
Gemini 3.1 Pro: lanzamiento, evaluaciones y comparación con GPT-5.2 y Claude Opus 4.6 Gemini 3.1 Pro: lanzamiento, evaluaciones y comparación con GPT-5.2 y Claude Opus 4.6

Herramientas

Gemini 3.1 Pro: lanzamiento, evaluaciones y comparación con GPT-5.2 y Claude Opus 4.6

Published

on

Google lanzó Gemini 3.1 Pro el 19 de febrero de 2026. Analizamos sus evaluaciones reales, precio verificado y comparativa frente a Claude Opus 4.6 y GPT-5.2.

El 19 de febrero de 2026, Google DeepMind lanzó Gemini 3.1 Pro, la actualización más significativa de la serie Gemini 3 desde su debut en noviembre de 2025. El modelo apunta a tareas complejas de ciencia, ingeniería e investigación, y llega semanas después del lanzamiento de Claude Opus 4.6 y Claude Sonnet 4.6 por parte de Anthropic (Google DeepMind, 2026).

¿Qué es Gemini 3.1 Pro y qué cambió respecto a su predecesor?

Gemini 3.1 Pro es un modelo de razonamiento nativo y multimodal capaz de procesar texto, imágenes, audio, video y repositorios de código de manera simultánea. La diferencia más concreta respecto a Gemini 3 Pro es la incorporación de un nivel de razonamiento mejorado que permite al modelo evaluar y reconducir su proceso antes de entregar una respuesta, con resultados especialmente visibles en problemas abstractos de múltiples pasos (Google DeepMind, 2026).

Una capacidad nueva y práctica es la generación de animaciones SVG directamente desde descripciones de texto. Al producirse en código puro y no en píxeles, estas animaciones permanecen nítidas en cualquier tamaño y pesan considerablemente menos que un video tradicional, lo que abre posibilidades concretas para diseñadores y desarrolladores sin herramientas adicionales (TrendingTopics, 2026).

Advertisement

Disponibilidad: dónde y cómo acceder

Google distribuyó el modelo en tres frentes simultáneos desde el día del lanzamiento (Google, 2026):

  • Desarrolladores: acceso en versión preliminar mediante la API de Gemini en Google AI Studio, Gemini CLI y Android Studio
  • Empresas: disponible en Vertex AI y Gemini Enterprise con soporte para flujos de trabajo corporativos
  • Usuarios finales: activo en la aplicación Gemini y en NotebookLM, con límites ampliados para suscriptores de Google AI Pro ($19.99 USD/mes) y Google AI Ultra ($124.99 USD/mes)

El lanzamiento es una versión preliminar. Google indicó que la disponibilidad general llegará una vez recopilada retroalimentación suficiente sobre flujos de trabajo agénticos avanzados (Google, 2026).

Resultados en evaluaciones: dónde lidera y dónde no

Gemini 3.1 Pro lidera en 12 de 19 evaluaciones comparativas frente a Claude Opus 4.6 y GPT-5.2, según datos publicados por PCMag y la tarjeta oficial del modelo de Google DeepMind (PCMag, 2026; Google DeepMind, 2026). Los resultados más representativos se muestran a continuación:

Evaluación Gemini 3.1 Pro Claude Opus 4.6 GPT-5.2
ARC-AGI-2 77.1% —* 54.2%
GPQA Diamond 94.3% 91.3% 92.4%
Humanity’s Last Exam (sin herramientas) 44.4% 41.2% 34.5%
Humanity’s Last Exam (con herramientas) 51.4% 53.1%
SWE-Bench Verified 80.6% 80.8% 76.2%
Terminal-Bench 2.0 68.5% 77.3% (GPT-5.3-Codex)
LiveCodeBench Pro (Elo) 2,887
APEX-Agents 33.5% 29.8% 23.0%

* El resultado de Claude Opus 4.6 en ARC-AGI-2 varía entre 37.6% y 68.8% según la fuente consultada. Al no poder confirmar el dato con la fuente primaria de Anthropic, se omite para evitar imprecisiones.

Vale la pena señalar que, cuando se activan herramientas de búsqueda y ejecución de código, Claude Opus 4.6 recupera terreno de forma notable. Esta diferencia sugiere que la integración con herramientas externas sigue siendo una ventaja de Claude para tareas que combinan razonamiento con acciones en el entorno real (NxCode, 2026). En programación de terminal especializada, GPT-5.3-Codex mantiene una ventaja concreta de casi nueve puntos porcentuales sobre Gemini.

Side-by-side comparison of different benchmarks for AI models.

Evolución frente a Gemini 3 Pro

El avance entre versiones es inusualmente amplio para una actualización de punto. Además del salto en ARC-AGI-2 —de 31.1% a 77.1%—, otras áreas con mejora documentada incluyen (TrendingTopics, 2026; Datacamp, 2026):

Advertisement
  • Humanity’s Last Exam: de 37.5% a 44.4%
  • Terminal-Bench 2.0: de 56.9% a 68.5%
  • BrowseComp (navegación web): de 59.2% a 85.9%
  • SciCode (computación científica): 59% frente al 52% compartido por Claude Opus 4.6 y GPT-5.2

¿Cuánto cuesta Gemini 3.1 Pro frente a sus rivales?

El precio es el argumento más concreto del modelo para equipos con alto volumen de consultas. Los precios verificados a la fecha del lanzamiento, con fuente primaria en Anthropic, OpenAI y Google, son los siguientes (ScriptByAI, 2026):

Modelo Entrada ≤200K Salida ≤200K Entrada >200K Salida >200K
Gemini 3.1 Pro $2.00 $12.00 $4.00 $18.00
Claude Sonnet 4.6 $3.00 $15.00 $6.00 $22.50
GPT-5.2 $1.75 $14.00 $1.75 $14.00
Claude Opus 4.6 $5.00 $25.00 $10.00 $37.50

Precios en USD por millón de componentes de texto. Fuente: páginas oficiales de precios de Google, Anthropic y OpenAI al 19 de febrero de 2026 (ScriptByAI, 2026).

Lo cierto es que GPT-5.2 resulta ligeramente más accesible en entrada ($1.75 frente a $2.00), pero la diferencia se invierte en salida, donde Gemini cobra $12.00 frente a los $14.00 de OpenAI. Para flujos de trabajo donde las respuestas son largas —generación de código extenso, documentos técnicos, análisis detallados— Gemini 3.1 Pro resulta la opción de menor costo entre los modelos de primer nivel. Con la función de almacenamiento en caché de contexto a $0.20 por millón de componentes almacenados, ese costo puede reducirse aún más en patrones de consulta repetitivos (ScriptByAI, 2026).

Especificaciones técnicas y capacidades multimodales

Gemini 3.1 Pro soporta una ventana de contexto de hasta un millón de componentes de entrada y genera respuestas de hasta 64,000 componentes de salida, lo que lo posiciona cinco veces por encima de Claude Opus 4.6 en capacidad de entrada. Ambos modelos obtienen un resultado idéntico en la prueba de recuperación MRCR v2 a 128,000 componentes —84.9%—, lo que indica calidad comparable dentro del rango compartido (TrendingTopics, 2026).

En cuanto a modalidades, el modelo procesa texto, imágenes, audio, video y código de forma nativa, sin módulos adicionales. Se integra con Veo 3.1 para generación de video con audio incorporado y con Lyria 3 para generación de música con marca de agua SynthID. Resulta particularmente interesante que esta cobertura multimodal completa no esté disponible en ningún modelo de OpenAI ni Anthropic a la fecha del lanzamiento (Google, 2026).

¿Qué modelo conviene según el tipo de tarea?

No existe un único modelo óptimo para todas las situaciones. La elección depende del tipo de tarea, el presupuesto y la necesidad de integración con herramientas externas. Estos son los escenarios donde cada modelo presenta ventajas concretas (NxCode, 2026; TrendingTopics, 2026):

Advertisement
  • Razonamiento científico e investigación: Gemini 3.1 Pro (GPQA Diamond 94.3%, Humanity’s Last Exam 44.4%)
  • Programación general: Claude Opus 4.6 gana por margen estrecho en SWE-Bench Verified (80.8% vs 80.6%)
  • Tareas de terminal especializadas: GPT-5.3-Codex (Terminal-Bench 2.0: 77.3%)
  • Análisis con herramientas activas: Claude Opus 4.6 (Humanity’s Last Exam con herramientas: 53.1%)
  • Documentos y repositorios extensos: Gemini 3.1 Pro (ventana de un millón de componentes)
  • Capacidades multimodales completas: Gemini 3.1 Pro (audio, video, imagen y código de forma nativa)
  • Alto volumen con presupuesto acotado en salida: Gemini 3.1 Pro ($12.00/M frente a $14.00 de GPT-5.2 y $25.00 de Claude Opus 4.6)

Para conocer el modelo en detalle, la documentación completa está disponible en el blog oficial de Google y en la tarjeta técnica de Google DeepMind.

Apple

Mac Mini como servidor en casa: guía para autohospedar Jellyfin y Plex

Published

on

Mac Mini como servidor en casa: guía para autohospedar Jellyfin y Plex
Si tienes un Mac mini con procesador Intel que ya no utilizas, puedes darle una segunda vida como servidor casero para organizar y reproducir tu biblioteca multimedia. Su tamaño compacto, conexión Ethernet y capacidad para funcionar sin monitor lo convierten en una opción interesante para el autohospedaje. (más…)

Continue Reading

Audio

Oats: la herramienta de IA open source para notas de reuniones locales y privadas

Published

on

Oats: la herramienta de IA open source para notas de reuniones locales y privadas

Oats graba tus reuniones directamente en tu Mac o Windows, genera resúmenes y listas de tareas sin usar bots ni nubes externas. Es open-source, gratuita y se integra con Obsidian. Descubre cómo funciona y por qué es una alternativa revolucionaria a herramientas como Otter.ai.

(más…)

Continue Reading

Apple

Guía de iOS 27: 29 novedades que cambian tu forma de usar el iPhone

Published

on

Guía de iOS 27: 29 novedades que cambian tu forma de usar el iPhone

iOS 27 ya está disponible y su propuesta va más allá del cambio anual de costumbre. Apple reorganiza parte de la experiencia del iPhone alrededor de Siri AI, Apple Intelligence y una serie de mejoras concretas en Fotos, Safari, Wallet, Salud, Mensajes y CarPlay. Esta guía reúne 29 novedades y aclara algo esencial antes de actualizar: no todas se activan en todos los modelos, ni en todos los idiomas, ni en todos los mercados.

(más…)

Continue Reading

Trending