OpenClawSkills
GitHub
Gateway / Operaciones • 5 min de lectura

Modelos Locales

Ejecutar OpenClaw en LLMs locales (LM Studio, vLLM, LiteLLM, endpoints OpenAI personalizados)

Local es viable, pero OpenClaw espera contexto grande + fuertes defensas contra inyección de prompt. Tarjetas pequeñas truncan contexto y filtran seguridad. Apunta alto: ''≥2 Mac Studios maximizados o rig GPU equivalente (~$30k+)''. Una sola GPU de ''24 GB'' funciona solo para prompts más ligeros con mayor latencia. Usa la ''variante de modelo más grande / completa que puedas ejecutar''; checkpoints agresivamente cuantizados o "pequeños" aumentan el riesgo de inyección de prompt (ver ''Seguridad'').

Tutorial.step

Recomendado: LM Studio + MiniMax M2.1 (API Responses, tamaño completo)

Mejor stack local actual. Carga MiniMax M2.1 en LM Studio, habilita el servidor local (predeterminado ''http://127.0.0.1:1234''), y usa API Responses para mantener el razonamiento separado del texto final.

Json5
{
  agents: {
    defaults: {
      model: { primary: "lmstudio/minimax-m2.1-gs32" },
      models: {
        "anthropic/claude-opus-4-5": { alias: "Opus" },
        "lmstudio/minimax-m2.1-gs32": { alias: "Minimax" },
      },
    },
  },
  models: {
    mode: "merge",
    providers: {
      lmstudio: {
        baseUrl: "http://127.0.0.1:1234/v1",
        apiKey: "lmstudio",
        api: "openai-responses",
        models: [
          {
            id: "minimax-m2.1-gs32",
            name: "MiniMax M2.1 GS32",
            reasoning: false,
            input: ["text"],
            cost: { input: 0, output: 0, cacheRead: 0, cacheWrite: 0 },
            contextWindow: 196608,
            maxTokens: 8192,
          },
        ],
      },
    },
},

Lista de verificación de configuración

- Instalar LM Studio: https://lmstudio.ai

- En LM Studio, descarga la ''compilación MiniMax M2.1 más grande disponible'' (evita variantes "pequeñas"/fuertemente cuantizadas), inicia el servidor, confirma que ''http://127.0.0.1:1234/v1/models'' lo liste.

- Mantén el modelo cargado; la carga en frío añade latencia de inicio.

- Ajusta ''contextWindow''/''maxTokens'' si tu compilación de LM Studio difiere.

- Para WhatsApp, mantente en API Responses para que solo el texto final sea enviado.

Mejor stack local actual. Carga MiniMax M2.1 en LM Studio, habilita el servidor local (predeterminado ''http://127.0.0.1:1234''), y usa API Responses para mantener el razonamiento separado del texto final.

Mantén modelos hospedados configurados incluso cuando ejecutes local; usa ''models.mode: "merge"'' para que los fallbacks permanezcan disponibles.

Tutorial.step

Configuración híbrida: hospedado primario, local como fallback

Json5
{
  agents: {
    defaults: {
      model: {
        primary: "anthropic/claude-sonnet-4-5",
        fallbacks: ["lmstudio/minimax-m2.1-gs32", "anthropic/claude-opus-4-5"],
      },
      models: {
        "anthropic/claude-sonnet-4-5": { alias: "Sonnet" },
        "lmstudio/minimax-m2.1-gs32": { alias: "MiniMax Local" },
        "anthropic/claude-opus-4-5": { alias: "Opus" },
      },
    },
  },
  models: {
    mode: "merge",
    providers: {
      lmstudio: {
        baseUrl: "http://127.0.0.1:1234/v1",
        apiKey: "lmstudio",
        api: "openai-responses",
        models: [
          {
            id: "minimax-m2.1-gs32",
            name: "MiniMax M2.1 GS32",
            reasoning: false,
            input: ["text"],
            cost: { input: 0, output: 0, cacheRead: 0, cacheWrite: 0 },
            contextWindow: 196608,
            maxTokens: 8192,
          },
        ],
      },
    },
},

#

Tutorial.step

Local-primero con red de seguridad hospedada

Intercambia el orden de primario y fallback; mantén el mismo bloque de proveedores y ''models.mode: "merge"'' para poder retroceder a Sonnet u Opus cuando el servidor local esté caído.

#

Tutorial.step

Hospedaje regional / enrutamiento de datos

- Variantes hospedadas de MiniMax/Kimi/GLM también existen en OpenRouter con endpoints fijados por región (ej., hospedado en US). Elige la variante regional allí para mantener el tráfico en tu jurisdicción elegida mientras usas ''models.mode: "merge"'' para fallbacks de Anthropic/OpenAI.

- Solo-local permanece como el camino de privacidad más fuerte; el enrutamiento regional hospedado es el punto medio cuando necesitas características del proveedor pero quieres control sobre el flujo de datos.

Tutorial.step

Otros proxies locales compatibles con OpenAI

Mantén ''models.mode: "merge"'' para que los modelos hospedados permanezcan disponibles como fallbacks.

Json5
{
  models: {
    mode: "merge",
    providers: {
      local: {
        baseUrl: "http://127.0.0.1:8000/v1",
        apiKey: "sk-local",
        api: "openai-responses",
        models: [
          {
            id: "my-local-model",
            name: "Local Model",
            reasoning: false,
            input: ["text"],
            cost: { input: 0, output: 0, cacheRead: 0, cacheWrite: 0 },
            contextWindow: 120000,
            maxTokens: 8192,
          },
        ],
      },
    },
}

Mantén ''models.mode: "merge"'' para que los modelos hospedados permanezcan disponibles como fallbacks.

Tutorial.step

Solución de problemas

- ¿El gateway puede alcanzar el proxy? ''curl http://127.0.0.1:1234/v1/models''.

- ¿Modelo de LM Studio descargado? Recarga; el inicio en frío es una causa común de "cuelgue".

- ¿Errores de contexto? Baja ''contextWindow'' o sube el límite de tu servidor.

- Seguridad: los modelos locales omiten filtros del lado del proveedor; mantén los agentes limitados y la compactación activada para limitar el radio de explosión de inyección de prompt.