Connect with us
DeepSeek V4.1 Flash corre en una sola RTX 3090 gracias a este proyecto DeepSeek V4.1 Flash corre en una sola RTX 3090 gracias a este proyecto

Desarrolladores

DeepSeek V4.1 Flash corre en una sola RTX 3090 gracias a este proyecto

Published

on

El proyecto open source dsv41-flash-offload logra servir DeepSeek V4.1 Flash, un modelo de unos 200GB en expertos, desde una única RTX 3090 de 24GB apoyada en RAM DDR4 y NVMe, con API compatible con OpenAI y contexto de 262,144 tokens.

Ejecutar un modelo gigante de razonamiento en hardware de consumo siempre pareció territorio exclusivo de los centros de datos. El proyecto dsv41-flash-offload, publicado en GitHub por sybil-solutions, desafía esa idea: sirve DeepSeek V4.1 Flash cuantizado en EXL3 a 3.0 bits por peso desde una sola RTX 3090 de 24GB, con la RAM del equipo y un NVMe cubriendo lo que la tarjeta no puede alojar. El avance importa porque demuestra que la IA local de gran escala ya no exige tarjetas de 80GB ni suscripciones a la nube, un terreno que OneDigital ya identificó al repasar los usos prácticos de los modelos de lenguaje locales frente a los chatbots de pago.

¿Cómo cabe un modelo de 200GB en una GPU de 24GB?

La clave está en la arquitectura de expertos (Mixture of Experts) del modelo: de sus 384 expertos enrutados repartidos en 40 capas MoE, solo una fracción se activa en cada paso de generación. El proyecto fija todos los expertos en la RAM del host y durante el prefill un motor de copia los transmite por tandas hacia espacios de VRAM, donde los expertos más solicitados corren como GEMMs en FP16. Durante la decodificación, una caché elástica en VRAM retiene a los expertos más calientes, mientras un kernel AVX2 ejecutado en los núcleos del CPU calcula los fallos de caché. Las tablas Engram de n-gramas permanecen mapeadas en memoria sobre el NVMe.

¿Qué rendimiento entrega esta configuración?

Las cifras medidas en la configuración por defecto (D141) son más que respetables para el hardware involucrado: decodificación de 19.3 tokens por segundo en flujo único, subiendo a 26.6 con cuatro flujos simultáneos, y prefill de 690 a 790 tokens por segundo en contextos que van de 8k a 261k. El banco de pruebas corrió sobre un AMD EPYC 7443P de 24 núcleos con 503GiB de RAM DDR4 en ocho canales y un NVMe Samsung 990 Pro de 4TB. Vale la pena señalar la calidad: 50 de 50 ejecuciones correctas en pruebas de recuperación de información en contextos largos, ejecución de código, matemáticas y ensayos extensos, según documenta el propio repositorio en su directorio de resultados.

Advertisement

Optimizaciones acumuladas por iteración

El proyecto es transparente sobre su evolución: cada mejora se registra como una “run” etiquetada. Añadió caché de prefijos, división de trabajo entre CPU y GPU para pasos cortos de agentes, y prefetch DMA entre capas. Uno de los saltos más notables es el almacenamiento en caché de prefijos: un turno de agente de 131k tokens con prefijo cacheado alcanza su primer token en 0.76 segundos en lugar de 200.8, una diferencia que convierte a la herramienta en algo realmente usable para agentes con historiales largos. También hay una rama experimental con una Intel Arc B70 como nivel de expertos que eleva la decodificación a 41.3 tokens por segundo con cuatro flujos, un 55 por ciento más, aunque su verificación de calidad sigue pendiente.

¿Qué se necesita para replicarlo?

La lista de requisitos es la de una estación de trabajo seria, pero alcanzable: una GPU de 24GB basada en Ampere, 256GiB o más de RAM, un CPU con AVX2 y 24 núcleos o más, y un NVMe rápido. Todo se distribuye como imagen Docker con API compatible con OpenAI, incluyendo llamadas de herramientas y razonamiento con los parsers propios de DeepSeek V4.1, lo que facilita conectarlo a clientes y agentes existentes. El contexto por defecto es de 262,144 tokens con caché KV en FP8. Para quienes dan sus primeros pasos en este mundo, montar un entorno de inferencia local con Ollama y Docker como base de una IA local sigue siendo el punto de partida natural antes de escalar a proyectos de esta magnitud.

¿Por qué importa para el futuro de la IA local?

Lo cierto es que el proyecto no es un truco de magia: exige hardware host generoso y el estado oficial es el de candidato, con la fidelidad del prefill por DMA escalonado apenas fuera del umbral heredado de la campaña de benchmarking. Aun así, la dirección es clara. Si un modelo de razonamiento de última generación con contexto de 262k puede correr en una GPU de consumo de hace años, la frontera entre IA local e IA de nube sigue desplazándose hacia el escritorio. Esa misma frontera es la que ya se nota en flujos de trabajo reales, como el uso de varios modelos de IA en OpenCode sin pagar suscripciones extra, donde alternar proveedores locales y en la nube deja de ser experimento y pasa a ser estrategia.

Android

Rool tu máquina de IA privada en la nube

Published

on

Rool tu máquina de IA privada en la nube

Regresar a un proyecto abandonado hace dos meses y encontrar todo todavía ahí: los archivos, las conversaciones, las decisiones, el contexto. Esa es la promesa de Rool, una computadora Linux privada en la nube alojada en la Unión Europea que guarda archivos, ejecuta software, conserva la memoria entre tareas e incluye modelos de IA autohospedados. Empieza gratis, sin tarjeta.

(más…)

Continue Reading

Desarrolladores

Cómo usar varios modelos de IA en OpenCode sin pagar suscripciones extra

Published

on

Cómo usar varios modelos de IA en OpenCode sin pagar suscripciones extra

Pagar una suscripción por cada herramienta de IA para programar encarece el flujo de trabajo y, en muchos casos, añade más fricción de la que elimina. La escena ya es conocida: una cuenta para OpenAI, otra para Claude, una tercera para el modelo que promete depurar mejor y, cuando entra en juego la privacidad o el costo, una aplicación aparte para correr modelos locales. El problema no es solo la factura. También es la fragmentación.

(más…)

Continue Reading

Desarrolladores

OpenBot: monta un equipo de agentes de IA en tu computadora, gratis y sin nube

Published

on

OpenBot: monta un equipo de agentes de IA en tu computadora, gratis y sin nube

¿Y si pudieras contratar un equipo de asistentes de IA que trabajara en tu propia computadora, con tus archivos, tu navegador y el plan de ChatGPT, Claude, Gemini o Grok que ya pagas? Eso es exactamente lo que propone OpenBot, una aplicación de escritorio gratuita que convierte varios agentes de IA en compañeros de trabajo persistentes, con espacios de trabajo dedicados, colas de tareas y hasta colaboración entre agentes.

(más…)

Continue Reading

Trending