Connect with us
Gemini 3.1 Pro: lanzamiento, evaluaciones y comparación con GPT-5.2 y Claude Opus 4.6 Gemini 3.1 Pro: lanzamiento, evaluaciones y comparación con GPT-5.2 y Claude Opus 4.6

Herramientas

Gemini 3.1 Pro: lanzamiento, evaluaciones y comparación con GPT-5.2 y Claude Opus 4.6

Published

on

Google lanzó Gemini 3.1 Pro el 19 de febrero de 2026. Analizamos sus evaluaciones reales, precio verificado y comparativa frente a Claude Opus 4.6 y GPT-5.2.

El 19 de febrero de 2026, Google DeepMind lanzó Gemini 3.1 Pro, la actualización más significativa de la serie Gemini 3 desde su debut en noviembre de 2025. El modelo apunta a tareas complejas de ciencia, ingeniería e investigación, y llega semanas después del lanzamiento de Claude Opus 4.6 y Claude Sonnet 4.6 por parte de Anthropic (Google DeepMind, 2026).

¿Qué es Gemini 3.1 Pro y qué cambió respecto a su predecesor?

Gemini 3.1 Pro es un modelo de razonamiento nativo y multimodal capaz de procesar texto, imágenes, audio, video y repositorios de código de manera simultánea. La diferencia más concreta respecto a Gemini 3 Pro es la incorporación de un nivel de razonamiento mejorado que permite al modelo evaluar y reconducir su proceso antes de entregar una respuesta, con resultados especialmente visibles en problemas abstractos de múltiples pasos (Google DeepMind, 2026).

Una capacidad nueva y práctica es la generación de animaciones SVG directamente desde descripciones de texto. Al producirse en código puro y no en píxeles, estas animaciones permanecen nítidas en cualquier tamaño y pesan considerablemente menos que un video tradicional, lo que abre posibilidades concretas para diseñadores y desarrolladores sin herramientas adicionales (TrendingTopics, 2026).

Advertisement

Disponibilidad: dónde y cómo acceder

Google distribuyó el modelo en tres frentes simultáneos desde el día del lanzamiento (Google, 2026):

  • Desarrolladores: acceso en versión preliminar mediante la API de Gemini en Google AI Studio, Gemini CLI y Android Studio
  • Empresas: disponible en Vertex AI y Gemini Enterprise con soporte para flujos de trabajo corporativos
  • Usuarios finales: activo en la aplicación Gemini y en NotebookLM, con límites ampliados para suscriptores de Google AI Pro ($19.99 USD/mes) y Google AI Ultra ($124.99 USD/mes)

El lanzamiento es una versión preliminar. Google indicó que la disponibilidad general llegará una vez recopilada retroalimentación suficiente sobre flujos de trabajo agénticos avanzados (Google, 2026).

Resultados en evaluaciones: dónde lidera y dónde no

Gemini 3.1 Pro lidera en 12 de 19 evaluaciones comparativas frente a Claude Opus 4.6 y GPT-5.2, según datos publicados por PCMag y la tarjeta oficial del modelo de Google DeepMind (PCMag, 2026; Google DeepMind, 2026). Los resultados más representativos se muestran a continuación:

Evaluación Gemini 3.1 Pro Claude Opus 4.6 GPT-5.2
ARC-AGI-2 77.1% —* 54.2%
GPQA Diamond 94.3% 91.3% 92.4%
Humanity’s Last Exam (sin herramientas) 44.4% 41.2% 34.5%
Humanity’s Last Exam (con herramientas) 51.4% 53.1% —
SWE-Bench Verified 80.6% 80.8% 76.2%
Terminal-Bench 2.0 68.5% — 77.3% (GPT-5.3-Codex)
LiveCodeBench Pro (Elo) 2,887 — —
APEX-Agents 33.5% 29.8% 23.0%

* El resultado de Claude Opus 4.6 en ARC-AGI-2 varía entre 37.6% y 68.8% según la fuente consultada. Al no poder confirmar el dato con la fuente primaria de Anthropic, se omite para evitar imprecisiones.

Vale la pena señalar que, cuando se activan herramientas de búsqueda y ejecución de código, Claude Opus 4.6 recupera terreno de forma notable. Esta diferencia sugiere que la integración con herramientas externas sigue siendo una ventaja de Claude para tareas que combinan razonamiento con acciones en el entorno real (NxCode, 2026). En programación de terminal especializada, GPT-5.3-Codex mantiene una ventaja concreta de casi nueve puntos porcentuales sobre Gemini.

Side-by-side comparison of different benchmarks for AI models.

Evolución frente a Gemini 3 Pro

El avance entre versiones es inusualmente amplio para una actualización de punto. Además del salto en ARC-AGI-2 —de 31.1% a 77.1%—, otras áreas con mejora documentada incluyen (TrendingTopics, 2026; Datacamp, 2026):

Advertisement
  • Humanity’s Last Exam: de 37.5% a 44.4%
  • Terminal-Bench 2.0: de 56.9% a 68.5%
  • BrowseComp (navegación web): de 59.2% a 85.9%
  • SciCode (computación científica): 59% frente al 52% compartido por Claude Opus 4.6 y GPT-5.2

¿Cuánto cuesta Gemini 3.1 Pro frente a sus rivales?

El precio es el argumento más concreto del modelo para equipos con alto volumen de consultas. Los precios verificados a la fecha del lanzamiento, con fuente primaria en Anthropic, OpenAI y Google, son los siguientes (ScriptByAI, 2026):

Modelo Entrada ≤200K Salida ≤200K Entrada >200K Salida >200K
Gemini 3.1 Pro $2.00 $12.00 $4.00 $18.00
Claude Sonnet 4.6 $3.00 $15.00 $6.00 $22.50
GPT-5.2 $1.75 $14.00 $1.75 $14.00
Claude Opus 4.6 $5.00 $25.00 $10.00 $37.50

Precios en USD por millón de componentes de texto. Fuente: páginas oficiales de precios de Google, Anthropic y OpenAI al 19 de febrero de 2026 (ScriptByAI, 2026).

Lo cierto es que GPT-5.2 resulta ligeramente más accesible en entrada ($1.75 frente a $2.00), pero la diferencia se invierte en salida, donde Gemini cobra $12.00 frente a los $14.00 de OpenAI. Para flujos de trabajo donde las respuestas son largas —generación de código extenso, documentos técnicos, análisis detallados— Gemini 3.1 Pro resulta la opción de menor costo entre los modelos de primer nivel. Con la función de almacenamiento en caché de contexto a $0.20 por millón de componentes almacenados, ese costo puede reducirse aún más en patrones de consulta repetitivos (ScriptByAI, 2026).

Especificaciones técnicas y capacidades multimodales

Gemini 3.1 Pro soporta una ventana de contexto de hasta un millón de componentes de entrada y genera respuestas de hasta 64,000 componentes de salida, lo que lo posiciona cinco veces por encima de Claude Opus 4.6 en capacidad de entrada. Ambos modelos obtienen un resultado idéntico en la prueba de recuperación MRCR v2 a 128,000 componentes —84.9%—, lo que indica calidad comparable dentro del rango compartido (TrendingTopics, 2026).

En cuanto a modalidades, el modelo procesa texto, imágenes, audio, video y código de forma nativa, sin módulos adicionales. Se integra con Veo 3.1 para generación de video con audio incorporado y con Lyria 3 para generación de música con marca de agua SynthID. Resulta particularmente interesante que esta cobertura multimodal completa no esté disponible en ningún modelo de OpenAI ni Anthropic a la fecha del lanzamiento (Google, 2026).

¿Qué modelo conviene según el tipo de tarea?

No existe un único modelo óptimo para todas las situaciones. La elección depende del tipo de tarea, el presupuesto y la necesidad de integración con herramientas externas. Estos son los escenarios donde cada modelo presenta ventajas concretas (NxCode, 2026; TrendingTopics, 2026):

Advertisement
  • Razonamiento científico e investigación: Gemini 3.1 Pro (GPQA Diamond 94.3%, Humanity’s Last Exam 44.4%)
  • Programación general: Claude Opus 4.6 gana por margen estrecho en SWE-Bench Verified (80.8% vs 80.6%)
  • Tareas de terminal especializadas: GPT-5.3-Codex (Terminal-Bench 2.0: 77.3%)
  • Análisis con herramientas activas: Claude Opus 4.6 (Humanity’s Last Exam con herramientas: 53.1%)
  • Documentos y repositorios extensos: Gemini 3.1 Pro (ventana de un millón de componentes)
  • Capacidades multimodales completas: Gemini 3.1 Pro (audio, video, imagen y código de forma nativa)
  • Alto volumen con presupuesto acotado en salida: Gemini 3.1 Pro ($12.00/M frente a $14.00 de GPT-5.2 y $25.00 de Claude Opus 4.6)

Para conocer el modelo en detalle, la documentación completa está disponible en el blog oficial de Google y en la tarjeta técnica de Google DeepMind.

Actualización

Un usuario logra que Windows 11 consuma solo 16 por ciento de RAM con 16GB

Published

on

Un usuario logra que Windows 11 consuma solo 16 por ciento de RAM con 16GB

El usuario @soyaakinohara6 compartió en X una instalación de Windows 11 que consume apenas 2.5GB de 16GB de RAM en reposo, un 16 por ciento de utilización. El método: instalar con Rufus, eliminar todo el bloatware y luego aplicar la actualización 26H2.

(más…)

Continue Reading

Android

Rool tu máquina de IA privada en la nube

Published

on

Rool tu máquina de IA privada en la nube

Regresar a un proyecto abandonado hace dos meses y encontrar todo todavía ahí: los archivos, las conversaciones, las decisiones, el contexto. Esa es la promesa de Rool, una computadora Linux privada en la nube alojada en la Unión Europea que guarda archivos, ejecuta software, conserva la memoria entre tareas e incluye modelos de IA autohospedados. Empieza gratis, sin tarjeta.

(más…)

Continue Reading

Curiosidades

ClawCall la IA que hace llamadas telefónicas por ti

Published

on

ClawCall la IA que hace llamadas telefónicas por ti

ClawCall es una inteligencia artificial que marca números de Estados Unidos, atraviesa los menús telefónicos, espera en la fila de retención y conversa con quien atienda. Al final reporta el resultado y la transcripción capturada. Funciona desde ChatGPT, Claude, iMessage y una API REST, con las primeras 30 llamadas gratis.

(más…)

Continue Reading

Lo más reciente

Lo más popular

Subscribete a nuestro Podcast

Trending