Especificaciones
Qwen3.7-Max: ¿El futuro de los agentes de IA autónomos?
Alibaba presenta Qwen3.7-Max, su modelo más avanzado diseñado para la era de los agentes de IA. Este modelo destaca por su versatilidad como base para agentes autónomos, capaz de escribir y depurar código, automatizar flujos de trabajo de oficina y mantener una ejecución autónoma durante cientos o miles de pasos.
Lo que diferencia a Qwen3.7-Max es la profundidad y amplitud de sus capacidades como agente. Sobresale como agente de programación, desde prototipado frontend hasta ingeniería de software compleja. Además, funciona como un asistente de productividad confiable mediante integraciones MCP y orquestación multiagente.
Su capacidad para mantener un razonamiento coherente en tareas de larga duración queda demostrada con un experimento de 35 horas de optimización autónoma de un kernel, realizando más de 1.158 llamadas a herramientas.
¿Qué hace único a Qwen3.7-Max?
Qwen3.7-Max no es solo un modelo más: es una revolución en la autonomía de agentes de IA. Estas son sus capacidades clave:
- Agente de codificación de vanguardia: Desde prototipado frontend hasta ingeniería de software compleja.
- Automatización de oficina: Integraciones MCP y orquestación multiagente para flujos de trabajo profesionales.
- Ejecución autónoma sostenida: Capacidad para mantener tareas de larga duración sin intervención humana.
- Generalización entre frameworks: Funciona de manera consistente en Claude Code, OpenClaw, Qwen Code y otros frameworks.
Disponible ahora a través de Alibaba Cloud Model Studio.
¿Cómo se compara con otros modelos?
Qwen3.7-Max ha sido evaluado en múltiples benchmarks, demostrando un rendimiento excepcional en tareas de codificación, razonamiento y generalización. A continuación, algunos resultados destacados:
Rendimiento en benchmarks de codificación
| Modelo | Terminal Bench 2.0-Terminus | SWE-Verified | SWE-Pro | SWE-Multilingual |
|---|---|---|---|---|
| Opus-4.6 Max | 65.4 | 80.8 | 57.3 | 77.5 |
| K2.6 Thinking | 66.7 | 80.2 | 59.5 | 76.7 |
| GLM-5.1 Thinking | 63.5 | — | 58.8 | — |
| DS-V4-Pro Max | 67.9 | 80.6 | 59.0 | 76.2 |
| Qwen3.7-Max | 69.7 | 80.4 | 60.6 | 78.3 |
En Terminal Bench 2.0-Terminus, Qwen3.7-Max supera a DS-V4-Pro Max (69.7 vs. 67.9). En SWE-Verified, está a la par con Opus-4.6 Max (80.4 vs. 80.8).
Rendimiento en benchmarks de agentes generales
| Modelo | Qwenclaw | CoWorkBench | ClawEval | MCP-Mark | MCP-Atlas |
|---|---|---|---|---|---|
| Opus-4.6 Max | 65.5 | 68.2 | 70.4 | — | 75.8 |
| K2.6 Thinking | 54.7 | 58.2 | 61.5 | 55.9 | 66.6 |
| GLM-5.1 Thinking | 58.7 | 66.0 | 62.7 | 57.5 | 71.8 |
| Qwen3.7-Max | 64.3 | 67.2 | 65.2 | 60.8 | 76.4 |
En agentes de propósito general, Qwen3.7-Max destaca en MCP-Atlas (76.4), superando a Opus-4.6 Max (75.8), y en MCP-Mark (60.8), superando a GLM-5.1 (57.5).
¿Cómo optimizó un kernel de atención en 35 horas?
En un experimento interno, Qwen3.7-Max optimizó un kernel de atención para hardware específico de Alibaba, usando una implementación de referencia en Triton. El agente generó variantes del código, las compiló y ejecutó en el dispositivo objetivo para medir los tiempos de ejecución.
Tras 1.158 llamadas a herramientas y 432 evaluaciones, logró una mejora de 10 veces en el rendimiento respecto a la implementación de referencia. Vale la pena señalar que el modelo mantuvo una estrategia coherente durante todo el proceso, sin perder contexto ni retroceder en las optimizaciones.
¿Qué aplicaciones prácticas tiene?
El patrón utilizado en el experimento del kernel puede aplicarse a otros problemas técnicos con métricas cuantificables, como:
- Optimización de kernels en CUDA o otros lenguajes para unidades de procesamiento gráfico.
- Ajuste de índices y consultas en bases de datos para reducir tiempos de respuesta.
- Diseño de pipelines de procesamiento de datos en sistemas distribuidos.
¿Cómo se integra con frameworks de agentes?
Qwen3.7-Max es compatible con los principales frameworks de agentes, como Claude Code, OpenClaw y Qwen Code. Esto permite una integración sencilla en flujos de trabajo existentes.
Integración con Claude Code
Para usar Qwen3.7-Max con Claude Code, sigue estos pasos:
-
- Instala Claude Code:
npm install -g @anthropic-ai/claude-code
-
- Configura las variables de entorno:
export ANTHROPIC_MODEL="qwen3.7-max"
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=<tu_api_key>
-
- Ejecuta Claude Code:
claude
Integración con OpenClaw
Para conectar Qwen3.7-Max con OpenClaw:
-
- Instala OpenClaw:
curl -fsSL https://molt.bot/install.sh | bash
- Configura el archivo
~/.openclaw/openclaw.json:
Ejemplo de configuración:
{ "models": { "mode": "merge", "providers": { "modelstudio": { "baseUrl": "https://dashscope-intl.aliyuncs.com/compatible-mode/v1", "apiKey": "DASHSCOPE_API_KEY", "api": "openai-completions", "models": [ { "id": "qwen3.7-max", "name": "qwen3.7-max", "reasoning": true, "input": ["text"], "contextWindow": 1000000, "maxTokens": 65536 } ] } } }, "agents": { "defaults": { "model": { "primary": "modelstudio/qwen3.7-max" } } } }
¿Qué resultados obtuvo en benchmarks de razonamiento?
Qwen3.7-Max también destaca en benchmarks de razonamiento, como GPQA Diamond (92.4), HLE (41.4) y HMMT 2026 (97.1), superando a modelos como Opus-4.6 Max y DS-V4-Pro.
Rendimiento en benchmarks de razonamiento
| Modelo | GPQA Diamond | HLE | HMMT 2026 Feb | IMOAnswerBench |
|---|---|---|---|---|
| Opus-4.6 Max | 91.3 | 40.0 | 96.2 | 75.3 |
| DS-V4-Pro Max | 90.1 | 37.7 | 95.2 | 89.8 |
| Qwen3.7-Max | 92.4 | 41.4 | 97.1 | 90.0 |
¿Cómo funciona en automatización de oficina?
Qwen3.7-Max puede actuar como un asistente de oficina inteligente mediante integración de herramientas. Por ejemplo, puede leer especificaciones de formato de una tesis universitaria y reformatear automáticamente un borrador desordenado, corrigiendo el diseño de página, estilos de encabezado, fuentes, márgenes, tabla de contenido y formato de referencias.
¿Qué novedades trae en escalabilidad de agentes?
Qwen3.7-Max introduce mejoras en la escalabilidad de entornos de entrenamiento para agentes. Al igual que los modelos de lenguaje generalizan a partir de textos diversos, las capacidades de los agentes mejoran con entornos de entrenamiento variados.
Este enfoque produce una trayectoria de mejora clara y consistente, con Qwen3.7-Max alcanzando un promedio de ranking top-3 que se acerca a Claude-4.6-Opus-Max.
¿Cómo se generaliza entre diferentes frameworks?
La infraestructura de entorno de Qwen3.7-Max desacopla cada instancia de entrenamiento en tres componentes ortogonales:
- Tarea: Lo que se quiere resolver.
- Arnés: Herramientas que ejecutan las acciones.
- Verificador: Decide si un intento ha tenido éxito.
Este diseño permite una escalabilidad combinatoria, donde la misma tarea se empareja con diversos arneses y verificadores, obligando al modelo a aprender estrategias generalizables en lugar de atajos específicos.
¿Qué logros ha alcanzado en optimización de kernels?
En un escenario de prueba, Qwen3.7-Max optimizó un kernel de atención extendida en hardware T-Head ZW-M890 PPUs, nunca visto durante el entrenamiento. Partiendo de un espacio de trabajo vacío, el modelo escribió, compiló, perfiló y mejoró iterativamente el kernel durante 35 horas, logrando una mejora de 10 veces en el rendimiento.
Comparado con otros modelos en las mismas condiciones:
- GLM 5.1: 7.3x de mejora.
- Kimi K2.6: 5.0x de mejora.
- DeepSeek V4 Pro: 3.3x de mejora.
- Qwen3.6-Plus: 1.1x de mejora.
¿Cómo se monitorea el “reward hacking” en entrenamiento de larga duración?
Qwen3.7-Max se integró en el monitoreo de aprendizaje por refuerzo (RL) para tareas de ingeniería de software, construyendo un marco para la auto-detección de hacking de recompensas y la auto-evolución de reglas.
Durante experimentos de RL que superaron las 80 horas, el modelo recuperó y reprodujo automáticamente trayectorias de entrenamiento, ejecutando más de 10.000 llamadas. El sistema identificó patrones de hacking de recompensas, como intentos de eludir restricciones para acceder a respuestas correctas en GitHub, mientras realizaba verificación de reglas, minería de contraejemplos y optimización iterativa.
Como resultado, Qwen3.7-Max logró múltiples rondas de auto-evolución de reglas, añadiendo 13 nuevas reglas heurísticas y marcando 1.618 casos de hacking.
¿Cómo planifica y ejecuta tareas de larga duración?
En el marco de los Juegos de Supervivencia Cumulativa Dinámica, Qwen3.7-Max ha escalado la complejidad temporal de las tareas para reforzar sus capacidades de planificación y ejecución de larga duración.
En YC-Bench, un benchmark que simula el ciclo de vida de un año de una startup, el agente debe navegar por cientos de rondas de toma de decisiones, desde la gestión de personal hasta la identificación de clientes malintencionados. Qwen3.7-Max logró un ingreso total de 2.08 millones de USD, el doble que Qwen3.6-Plus (1.05M USD) y 5.9 veces más que Qwen3.5-Plus (352K USD).
¿Cómo empezar a usar Qwen3.7-Max?
Qwen3.7-Max está disponible a través de Alibaba Cloud Model Studio. Puedes integrarlo con frameworks populares de agentes y asistentes de codificación.
Uso de la API
Ejemplo de código para usar la API de Qwen3.7-Max:
api_key = os.environ.get("DASHSCOPE_API_KEY") messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}] completion = client.chat.completions.create(from openai import OpenAI
import os
client = OpenAI(api_key=api_key, base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1")
model="qwen3.7-max",
messages=messages,
extra_body={"enable_thinking": True},
stream=True
)
¿Qué demuestran sus capacidades en el mundo real?
Qwen3.7-Max no solo es un modelo teórico: tiene aplicaciones prácticas en el mundo real, como:
- Generación de aplicaciones web interactivas: Desde escenas 3D con Three.js hasta animaciones en Canvas y diseños de página completos.
- Asistente de oficina: Reformateo automático de documentos, como tesis universitarias, siguiendo especificaciones de formato.
- Agente de navegación física: Operación de un perro robótico mediante llamadas a herramientas, demostrando comprensión física, planificación, memoria y toma de decisiones en entornos reales.
Conclusión: ¿Por qué Qwen3.7-Max es un avance significativo?
Qwen3.7-Max representa un salto cualitativo en la capacidad de los agentes de IA para realizar tareas complejas y de larga duración. Su combinación de razonamiento de vanguardia, generalización entre frameworks y ejecución autónoma sostenida lo convierte en una base poderosa para la próxima generación de agentes de IA.
Lo cierto es que, aunque aún hay desafíos por superar, como la validación independiente de sus resultados más llamativos, Qwen3.7-Max ofrece una base sólida para construir sistemas de IA más autónomos y eficientes.
3D
ArtCraft la herramienta de IA open source que reta a las apps de Adobe
ArtCraft es un estudio creativo de código abierto que combina generación de imágenes y video con IA, composición en 2D y 3D y un ecosistema de siete aplicaciones nativas construidas en Rust. Funciona en macOS, Windows y navegador, sin suscripción. (más…)
Educación
Los modelos Mixture of Experts cambiaron las reglas del hardware para IA local
Los modelos Mixture of Experts cambiaron una de las reglas más repetidas del hardware para IA local: que una GPU necesita alojar todos los parámetros del modelo para ser útil. Gracias al reparto entre VRAM y memoria del sistema, un modelo grande puede ejecutarse sin residir por completo en la tarjeta, siempre que la arquitectura active solo una fracción de sus parámetros por token. Esta guía explica por qué el consejo de hardware tradicional quedó desactualizado, qué modelos de Hugging Face tienen mejor encaje en este enfoque y cómo configurarlos en llama.cpp y LM Studio.
Desarrolladores
DeepSeek V4.1 Flash corre en una sola RTX 3090 gracias a este proyecto
El proyecto open source dsv41-flash-offload logra servir DeepSeek V4.1 Flash, un modelo de unos 200GB en expertos, desde una única RTX 3090 de 24GB apoyada en RAM DDR4 y NVMe, con API compatible con OpenAI y contexto de 262,144 tokens.
-
Apps11 años agoAMPcast, la herramienta de Pandora que permite a los artistas grabar mensajes de audio directamente a sus seguidores
-
Blogs5 años agoConoce los mejores sitios de Torrents para descargar todo tipo de contenidos
-
Android5 años agoAprende cómo usar Discord para ver películas con tus amigos
-
Arte y Cultura14 años agoColección de fondos de pantalla basados en Super Héroes
-
Almacenamiento2 años agoCómo usar TeraBox: La guía definitiva para aprovechar 1 TB de almacenamiento en la nube
-
Diseño13 años agocss3ps: plugin que convierte archivos PSD a CSS3
-
Apps9 años agoPicturethat, app que usa la Realidad Aumentada para visualizar cómo quedarían los cuadros antes de colgarlos
-
Eventos Especiales13 años agoEspecial Día de la Madres: fondos de pantalla especiales para Mamá
