Connect with us
¿Cómo usar Claude Code con LM Studio y Qwen3.5 de forma local? ¿Cómo usar Claude Code con LM Studio y Qwen3.5 de forma local?

Desarrolladores

¿Cómo usar Claude Code con LM Studio y Qwen3.5 de forma local?

Published

on

Ejecuta Claude Code con modelos locales usando LM Studio 0.4.6. Sin cuenta de pago, sin enviar datos a la nube.

Claude Code es la herramienta de programación asistida por inteligencia artificial de línea de comandos desarrollada por Anthropic. A diferencia de los asistentes de código convencionales, Claude Code interpreta el contexto de un proyecto completo: lee archivos, crea nuevos, instala dependencias y ejecuta comandos de forma autónoma. Por defecto requiere una suscripción de pago a Claude Pro o Max, que cuesta entre 20 y 200 dólares mensuales. Sin embargo, existe una alternativa completamente gratuita: redirigir todas sus peticiones a un modelo descargado en tu propio equipo mediante LM Studio 0.4.6, que desde la versión 0.4.1 expone un punto de acceso compatible con la interfaz de programación de Anthropic.

¿Qué se necesita antes de comenzar?

La combinación funciona en Windows, macOS y Linux. Los requisitos varían según el modelo elegido, pero la configuración del software es idéntica en los tres sistemas.

  • LM Studio: versión 0.4.6 o superior — descarga en lmstudio.ai
  • Node.js: versión 18 o superior
  • Claude Code: versión 1.x (instalación gratuita, detallada más adelante)
  • Memoria RAM o unificada: mínimo 16 GB para modelos de 9B; 20-24 GB para Qwen3.5-35B-A3B
  • Almacenamiento: entre 8 GB y 25 GB según modelo y nivel de cuantización

¿Qué es Claude Code y cómo se instala gratis?

Claude Code es de código abierto. La herramienta en sí no tiene costo; lo que se paga normalmente es el consumo de la interfaz de programación oficial de Anthropic. Al usar LM Studio como servidor local, ese costo desaparece. La instalación se realiza desde la terminal con Node.js.

# Mac y Linux
curl -fsSL https://claude.ai/install.sh | bash

# Cualquier sistema con Node.js
npm install -g @anthropic-ai/claude-code

Una vez instalado, verifica la instalación con claude --version. Si aparece un número de versión, la instalación fue exitosa.

Advertisement

¿Qué modelo local conviene usar?

Qwen3.5-35B-A3B es el modelo de arquitectura de mezcla de expertos desarrollado por Alibaba y publicado en febrero de 2026. Tiene 35 mil millones de parámetros en total, pero activa aproximadamente 3 mil millones por inferencia, lo que lo hace comparable en velocidad a modelos densos de 7B con un nivel de razonamiento considerablemente superior. La versión 0.4.6 de LM Studio incluye además una corrección específica para este modelo. Es el punto de entrada recomendado para tareas de programación autónoma dentro de 24 GB de memoria.

  • Qwen3.5-35B-A3B (Q4_K_XL) — Recomendado para 20-24 GB; balance óptimo entre precisión y tamaño en disco
  • Qwen3.5-35B-A3B (Q2_K_XL) — Para equipos con 16 GB; menor precisión pero funcional
  • Qwen3.5-27B — Mayor capacidad de razonamiento; requiere más memoria y es más lento
  • Qwen3.5-9B / 4B — Para equipos con menos de 12 GB; adecuado para tareas simples y bien definidas
  • GLM-4.7-Flash — Alternativa de arquitectura de mezcla de expertos con características similares

LM Studio frente a llama.cpp: ¿cuál conviene?

Ambas herramientas funcionan como servidor local para Claude Code, pero tienen perfiles distintos según el nivel técnico y el sistema operativo del usuario.

Criterio LM Studio 0.4.6 llama.cpp (llama-server)
Instalación Interfaz gráfica, sin compilar Requiere compilar desde código fuente
Descarga de modelos Integrada en la aplicación Manual con herramientas externas
Ajuste de parámetros Panel visual y por interfaz de programación Solo por línea de comandos
Compatibilidad en Windows Completa y nativa Funcional con configuración adicional
Uso desde equipo remoto en red local Sí, mediante LM Link Sí, exponiendo el puerto manualmente
Actualizaciones Automáticas desde la aplicación Recompilación manual necesaria
Perfil de usuario Principiante a intermedio Intermedio a avanzado

Configuración paso a paso

Paso 1: Descargar el modelo en LM Studio

Abre LM Studio y ve a la pestaña Discover. Busca Qwen3.5-35B-A3B y descarga la variante Q4_K_XL. Si tu equipo tiene menos de 20 GB de memoria disponible, selecciona la variante Q2_K_XL.

Paso 2: Iniciar el servidor local

  1. Abre la pestaña Developer en LM Studio
  2. Selecciona el modelo descargado en el selector superior
  3. En la sección Context Length, establece el valor en 25000 como mínimo — valores por debajo de ese número bloquean a Claude Code durante tareas largas
  4. Presiona Start Server o en la terminal escribe lms status
  5. Confirma que el servidor está activo con lms status en la terminal

Paso 3: Ajustar parámetros de muestreo para Qwen3.5

Qwen recomienda los siguientes valores para el modo de razonamiento. Se configuran desde Model Config → Advanced en LM Studio antes de iniciar el servidor.

  • Temperatura: 0.6
  • Top-P: 0.95
  • Top-K: 20
  • Min-P: 0.00

Paso 4: Conectar Claude Code al servidor local

Solo se necesitan dos variables de entorno. Claude Code detecta ANTHROPIC_BASE_URL y redirige todas sus peticiones al servidor de LM Studio en lugar de los servidores de Anthropic.

Mac y Linux:

export ANTHROPIC_BASE_URL=http://localhost:1234
export ANTHROPIC_AUTH_TOKEN=lmstudio

# Para que persistan en nuevas sesiones de terminal
echo 'export ANTHROPIC_BASE_URL=http://localhost:1234' >> ~/.bashrc
echo 'export ANTHROPIC_AUTH_TOKEN=lmstudio' >> ~/.bashrc

Windows (PowerShell):

$env:ANTHROPIC_BASE_URL = "http://localhost:1234"
$env:ANTHROPIC_AUTH_TOKEN = "lmstudio"

# Para que persistan entre sesiones
[System.Environment]::SetEnvironmentVariable("ANTHROPIC_BASE_URL","http://localhost:1234","User")
[System.Environment]::SetEnvironmentVariable("ANTHROPIC_AUTH_TOKEN","lmstudio","User")

Si tienes autenticación habilitada en LM Studio, sustituye lmstudio por el código de acceso generado en la configuración de la aplicación.

Advertisement

Paso 5: Corrección obligatoria para la velocidad de respuesta

Claude Code incluye en cada petición un encabezado de atribución que invalida la memoria caché interna del servidor, lo que puede degradar la velocidad de respuesta de forma notable. Esta corrección debe aplicarse en el archivo de configuración, no como variable de entorno, ya que por esa vía no tiene efecto.

En Mac y Linux el archivo se encuentra en ~/.claude/settings.json. En Windows está en %USERPROFILE%\.claude\settings.json. Crea o edita ese archivo con el siguiente contenido:

{
  "promptSuggestionEnabled": false,
  "env": {
    "CLAUDE_CODE_ENABLE_TELEMETRY": "0",
    "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1",
    "CLAUDE_CODE_ATTRIBUTION_HEADER": "0"
  },
  "attribution": {
    "commit": "",
    "pr": ""
  },
  "effortLevel": "high"
}

Paso 6: Iniciar Claude Code

mkdir mi-proyecto && cd mi-proyecto
claude --model qwen3.5-35b-a3b

Si Claude Code solicita inicio de sesión en Anthropic, añade el siguiente bloque al archivo ~/.claude.json (o %USERPROFILE%\.claude.json en Windows) y vuelve a ejecutar el comando:

{
  "hasCompletedOnboarding": true,
  "primaryApiKey": "sk-dummy-key"
}

En VS Code, si usas la extensión de Claude Code, agrega las variables en el archivo settings.json del editor:

"claudeCode.environmentVariables": [
  { "name": "ANTHROPIC_BASE_URL", "value": "http://localhost:1234" },
  { "name": "ANTHROPIC_AUTH_TOKEN", "value": "lmstudio" }
]

Ejemplo práctico: organizador automático de archivos

Una vez que el sistema esté funcionando, este ejemplo permite comprobar que todo opera correctamente y, al mismo tiempo, produce algo útil de inmediato. El siguiente indicador le pide a Claude Code que cree un programa en Python que organice los archivos de una carpeta por tipo, moviéndolos a subcarpetas automáticas. No requiere instalar ninguna biblioteca adicional.

Advertisement

Escribe esto directamente en la terminal de Claude Code:

Crea un script en Python llamado organizar.py que haga lo siguiente:
- Lea todos los archivos de la carpeta que el usuario indique como argumento
- Los mueva a subcarpetas según su extensión (imágenes, documentos, videos, música, otros)
- Muestre un resumen de cuántos archivos movió a cada carpeta
- No borre ni sobreescriba ningún archivo existente
- Funcione en Windows, Mac y Linux sin instalar bibliotecas externas

Claude Code analizará el indicador, creará el archivo organizar.py en la carpeta del proyecto y mostrará el código generado. El resultado esperado se verá similar a esto:

python organizar.py /Users/usuario/Descargas

✓ Imágenes   → 24 archivos movidos  (jpg, png, gif, webp)
✓ Documentos → 11 archivos movidos  (pdf, docx, xlsx, txt)
✓ Videos     → 6 archivos movidos   (mp4, mov, avi)
✓ Música     → 3 archivos movidos   (mp3, flac, wav)
✓ Otros      → 8 archivos movidos

Total: 52 archivos organizados

Si el modelo responde con código funcional y bien estructurado, la integración entre Claude Code y LM Studio está operativa. Si aparece un error de conexión, verifica que el servidor de LM Studio sigue activo y que las variables de entorno están asignadas en la sesión actual de la terminal.

LM Link: inferencia desde otro equipo en la misma red

LM Studio 0.4.6 introduce LM Link, una función que permite exponer el servidor de un equipo con tarjeta gráfica potente y consumirlo desde una computadora portátil con hardware más limitado, sin configurar redes privadas virtuales ni servidores externos. Todo el procesamiento sigue ocurriendo en el equipo con la tarjeta gráfica y los datos no salen de la red privada. La configuración se realiza desde la pestaña Developer → LM Link en la aplicación.

¿Por qué los modelos pequeños fallan con Claude Code?

Claude Code genera internamente un indicador de sistema que puede superar los 15,000 componentes léxicos entre instrucciones, descripciones de herramientas y contexto del proyecto. Modelos por debajo de 9B parámetros generalmente no mantienen coherencia en ese contexto extendido y entran en ciclos repetitivos sin completar las tareas. Para proyectos con múltiples archivos o dependencias, Qwen3.5-35B-A3B es el punto de entrada recomendable. Los modelos de 9B funcionan bien solo para tareas acotadas y con instrucciones muy específicas.

Advertisement

Solución a los problemas más frecuentes

  • Error: model not found — El nombre del modelo en --model no coincide con el alias mostrado en LM Studio. Cópialo directamente desde la interfaz de la aplicación.
  • Connection refused — El servidor de LM Studio no está activo o el puerto es incorrecto. Verifica con lms status en la terminal.
  • Claude Code solicita inicio de sesión en bucle — Añade el bloque de configuración en ~/.claude.json descrito en el paso 6.
  • Respuestas lentas aunque el archivo settings.json existe — Verifica que el archivo no tenga errores de sintaxis ejecutando cat ~/.claude/settings.json | python3 -m json.tool.
  • Claude Code se bloquea en tareas largas — El valor de longitud de contexto en LM Studio está por debajo de 25,000. Aumenta ese valor, detén el servidor y vuelve a iniciarlo.
  • Respuestas de baja calidad con Qwen3.5 — Verifica que los parámetros de muestreo del paso 3 estén aplicados. Temperatura por encima de 0.8 degrada notablemente la coherencia de este modelo.

 

Curiosidades

Suyu 0.0.4 introduce recompilación estática en la emulación de Nintendo Switch

Published

on

Suyu 0.0.4 introduce recompilación estática en la emulación de Nintendo Switch
La emulación de Nintendo Switch en PC sumó un movimiento técnico relevante con Suyu 0.0.4, la última versión pública del proyecto. Su novedad principal es la incorporación de Recompiler mode, un enfoque de recompilación estática que busca reducir parte de la sobrecarga habitual de la emulación tradicional, especialmente en escenarios donde la CPU condiciona el rendimiento. (más…)

Continue Reading

Arte y Cultura

ChatGPT Imágenes 2.5: más detalles edición precisa y generación un 50% más rápida

Published

on

ChatGPT Imágenes 2.5: más detalles edición precisa y generación un 50% más rápida

OpenAI lanza ChatGPT Imágenes 2.5, su modelo de generación de imágenes con mayor fidelidad, edición precisa y un 50% menos de latencia, para revolucionar la creación visual en usuarios y desarrolladores.

(más…)

Continue Reading

Audio

Nemotron 3.5 ASR: el modelo de NVIDIA para transcribir 40 locales de idioma en tiempo real

Published

on

Nemotron 3.5 ASR: el modelo de NVIDIA para transcribir 40 locales de idioma en tiempo real

NVIDIA ha lanzado Nemotron 3.5 ASR Streaming 0.6B, un modelo de reconocimiento automático de voz (ASR) con 600 millones de parámetros diseñado para transcripción multilingüe en streaming. Disponible en Hugging Face, este modelo admite 40 locales de idioma desde un solo checkpoint, integra puntuación y capitalización en la salida, y permite ajustar la latencia desde 80 milisegundos hasta 1.12 segundos, según la configuración elegida.

(más…)

Continue Reading

Lo más reciente

Lo más popular

Subscribete a nuestro Podcast

Trending