AI AGENTS

OpenClaw: Despliega tu Asistente AI Personal en WhatsApp y Telegram

Construye y despliega tu propio asistente AI que vive en WhatsApp y Telegram. Interacción por voz, automatización del navegador, cron jobs, skills personalizados y diseño completo de personalidad con AGENTS.md, SOUL.md y MEMORY.md.

Por Jose Nobile | Actualizado 2026-06-11 | 18 min de lectura

¿Qué es OpenClaw?

OpenClaw es un framework open-source para desplegar asistentes AI personales en plataformas de mensajería. A diferencia de chatbots genéricos, OpenClaw crea un AI persistente con personalidad que te conoce, recuerda contexto entre conversaciones, y puede ejecutar acciones en el mundo real — desde navegar la web hasta gestionar tu calendario.

Está construido sobre una arquitectura distribuida con un gateway central, múltiples nodos (cada uno corriendo en diferentes máquinas), y canales (WhatsApp, Telegram, Slack, etc.). Este diseño significa que tu asistente AI puede correr en tu laptop, un VPS o una Raspberry Pi, y tú interactúas desde cualquier app de mensajería.

Lo que hace único a OpenClaw es su sistema de personalidad. A través de archivos AGENTS.md, SOUL.md y MEMORY.md, defines no solo qué puede hacer tu asistente, sino quién es — su estilo de comunicación, valores, áreas de conocimiento y límites de comportamiento.

Arquitectura: Gateway, Nodos, Canales

CORE

Gateway

La capa central de ruteo que conecta canales con nodos. El gateway maneja ruteo de mensajes, autenticación, gestión de sesiones y balanceo de carga. Puede correr como un proceso liviano en cualquier servidor.

CORE

Nodos

Ambientes de ejecución donde corre tu agente AI. Cada nodo puede hospedar diferentes capacidades (automatización de navegador, acceso al sistema de archivos, herramientas específicas). Múltiples nodos pueden servir un solo agente para redundancia.

CORE

Canales

Integraciones con plataformas de mensajería. WhatsApp (vía WhatsApp Business API o web bridge), Telegram Bot API, Slack y más. Cada adaptador de canal traduce mensajes específicos de la plataforma al formato unificado de OpenClaw.

FEATURE

Voz I/O (Whisper)

Pipeline de audio completo: los mensajes de voz entrantes se transcriben vía un servidor Whisper local o remoto, y las respuestas pueden sintetizarse de vuelta a audio. Casos de uso: interacción manos libres al manejar, dictado de notas y accesibilidad para usuarios que prefieren hablar antes que escribir.

FEATURE

Canvas UI

Una interfaz web opcional tipo canvas para interacciones ricas que van más allá del texto. El canvas renderiza tarjetas interactivas, tablas de datos, gráficos y formularios directamente en el navegador, complementando los canales de mensajería con un espacio de trabajo visual. Casos de uso: vistas de dashboard, gestión de tareas con drag-and-drop y exploración visual de datos.

FEATURE

Emparejamiento de Nodos

Empareja múltiples nodos a un solo gateway intercambiando un token de emparejamiento. Cada dispositivo (laptop, VPS, Raspberry Pi) se registra como un nodo separado con sus propias capacidades. El gateway rutea tareas al mejor nodo disponible. Casos de uso: correr tareas pesadas de navegador en un nodo cloud mientras mantienes acceso a archivos en una máquina local.

La arquitectura soporta múltiples usuarios concurrentes, cada uno con su propia personalidad de agente y memoria. Un solo gateway puede rutear mensajes a diferentes nodos según identidad de usuario, tipo de mensaje o condiciones de carga.

Los nodos se comunican con el gateway vía conexiones WebSocket, habilitando entrega de mensajes en tiempo real y streaming bidireccional para interacciones de voz. El protocolo está diseñado para redes inestables — los mensajes se encolan y reintentan si un nodo se desconecta temporalmente.

Instalación y Configuración

OpenClaw corre en Node.js 24 (recomendado) o 22.16+ y requiere algunas variables de entorno para API keys y credenciales de canales. El proceso de instalación está optimizado para desarrolladores familiarizados con npm:

git clone https://github.com/open-claw/openclaw.git
cd openclaw
npm install
cp .env.example .env # Configure your API keys
npm start

La configuración se divide en dos áreas: infraestructura (puertos del gateway, direcciones de nodos, credenciales de canales) en .env y archivos de configuración del ambiente, y personalidad/comportamiento en los archivos Markdown (AGENTS.md, SOUL.md, MEMORY.md).

API Keys Requeridas

API key de Anthropic (para Claude), token de WhatsApp Business API o web bridge, token de Telegram Bot de @BotFather. Opcional: Whisper local + Qwen3-TTS para voz, Browserbase o Puppeteer local para automatización de navegador.

Configuración de Nodos

Cada nodo define sus capacidades, herramientas disponibles y límites de recursos. Los nodos pueden configurarse para manejar tipos específicos de requests (texto, voz, tareas de navegador) o servir como ejecutores de propósito general.

Setup Multi-Máquina

Para deploys avanzados, corre el gateway en un VPS con IP estática, y los nodos en máquinas locales o instancias cloud. El gateway maneja traversal de NAT y mantiene conexiones vivas entre cambios de red.

AGENTS.md / SOUL.md / MEMORY.md

El sistema de personalidad es lo que transforma un AI genérico en tu asistente personal. Tres archivos Markdown definen el perfil de comportamiento completo:

PERSONALITY

AGENTS.md

Define las capacidades del agente, herramientas disponibles, registro de skills y límites operacionales. Este es el archivo "qué puede hacer" — listando cada skill, sus condiciones de activación y parámetros de ejecución.

PERSONALITY

SOUL.md

Define la personalidad del agente, estilo de comunicación, valores y principios de comportamiento. Este es el archivo "quién es" — tono de voz, preferencias de idioma, estilo de humor, nivel de empatía y patrones de respuesta.

PERSONALITY

MEMORY.md

Memoria persistente que el agente lee y escribe. Contiene preferencias del usuario, interacciones pasadas, datos aprendidos y notas contextuales. El agente actualiza este archivo a medida que aprende sobre ti.

Un SOUL.md bien diseñado transforma la experiencia de usuario dramáticamente. El asistente de Jose habla en español argentino natural, usa conjugación con vos, referencia contexto compartido, y ajusta la formalidad según el tema — las discusiones técnicas son precisas, las conversaciones casuales son cálidas y con humor.

Configuración de WhatsApp y Telegram

La configuración de canales implica configurar la API de la plataforma de mensajería y conectarla a tu gateway de OpenClaw. Cada plataforma tiene diferentes requisitos y capacidades:

CHANNEL

WhatsApp

Dos opciones: WhatsApp Business API (oficial, requiere verificación Meta Business, soporta mensajes enriquecidos) o web bridge (no oficial, setup más simple, cuenta personal). El web bridge funciona conectándose al protocolo de WhatsApp Web.

CHANNEL

Telegram

Crea un bot vía @BotFather, obtén el token, y configúralo en OpenClaw. Telegram soporta teclados inline, subida de archivos, mensajes de voz y chat grupal — todo manejado nativamente por el adaptador del canal Telegram.

Ambos canales soportan texto, mensajes de voz (transcritos vía Whisper o similar), imágenes (analizadas vía modelos de visión) y archivos adjuntos. El adaptador del canal normaliza todos los tipos de mensaje en un formato unificado antes de pasarlos al agente.

Para WhatsApp, los mensajes de voz son particularmente poderosos — puedes hablar naturalmente con tu asistente AI mientras manejas o caminas, y responde con voz sintetizada o texto según tu preferencia.

Interacción por Voz

OpenClaw soporta interacción completa por voz: speech-to-text para mensajes de voz entrantes y text-to-speech para respuestas. El pipeline de voz se integra con múltiples proveedores:

  • Speech-to-Text — OpenAI Whisper (local o API), Google Speech-to-Text, o Deepgram para transcripción en tiempo real
  • Text-to-Speech — Qwen3-TTS (local, perfiles de voz), LuxTTS (clonación de voz, 150x realtime), OpenAI TTS, o Google TTS para síntesis de respuestas
  • Modo voz — Configura el agente para responder siempre con voz, solo al recibir voz, o basado en longitud del mensaje y contexto

Las interacciones por voz se sienten naturales porque el agente mantiene contexto conversacional. Puedes empezar un hilo de voz sobre un tema, cambiar a texto, y el agente continúa la conversación sin problemas entre modalidades.

Desarrollo de Skills

Los skills son los bloques de construcción de las capacidades de tu agente. Cada skill es un módulo autocontenido que el agente puede invocar cuando lo necesita. Los skills van desde simples (consulta del clima) hasta complejos (automatización de navegador de múltiples pasos con extracción de datos).

SKILL

Búsqueda Web

Busca en la web usando APIs de DuckDuckGo, Google o Brave. El agente resume resultados y puede seguir links para extraer información detallada de páginas específicas.

SKILL

Gestión de Calendario

Integra con Google Calendar para verificar disponibilidad, crear eventos, enviar invitaciones y proveer briefings diarios. El agente puede negociar horarios de reunión entre zonas horarias.

SKILL

Operaciones de Archivos

Lee, escribe y gestiona archivos en el sistema de archivos del nodo. Genera reportes, procesa CSVs, crea documentos y envíalos de vuelta por el canal de mensajería.

SKILL

Monitoreo del Sistema

Verifica salud del servidor, uso de disco, procesos en ejecución y contenedores Docker. Recibe alertas proactivas cuando los recursos superan umbrales y obtén sugerencias de troubleshooting.

Crear un skill personalizado implica definir un esquema de herramienta (nombre, descripción, parámetros) y un handler de ejecución. Los skills se registran en AGENTS.md y pueden declarar dependencias de otros skills o APIs externas.

Cron Jobs y Automatización

El sistema de cron de OpenClaw permite que tu agente ejecute tareas programadas sin interacción del usuario. Los cron jobs se definen en la configuración y pueden disparar cualquier skill o secuencia de skills:

  • Briefings diarios — Resumen matutino de clima, calendario, noticias y tareas pendientes enviado a tu WhatsApp
  • Recordatorios de salud — Recordatorios de suplementos, alertas de ingesta de agua, avisos de entrenamiento en horarios configurados
  • Chequeos de monitoreo — Reportes horarios de salud del servidor, alertas de vencimiento de certificados SSL, monitoreo de uptime
  • Recolección de datos — Scrapea precios, rastrea envíos, monitorea niveles de stock y reporta cambios

Los cron jobs usan sintaxis cron estándar y pueden ser condicionales — por ejemplo, solo enviar el briefing matutino en días hábiles, o solo alertar sobre problemas del servidor si el CPU supera 80%.

Automatización del Navegador

La automatización del navegador le da a tu agente la capacidad de interactuar con cualquier sitio web como lo haría un usuario. Construido sobre Puppeteer, el skill de navegador puede navegar páginas, completar formularios, hacer clic en botones, extraer datos y tomar capturas de pantalla.

Casos de uso comunes incluyen:

  • Completar formularios repetitivos (portales gubernamentales, registros)
  • Extraer datos de sitios web que no tienen APIs
  • Monitorear cambios de precios en sitios de e-commerce
  • Tomar capturas de pantalla para verificación visual o reportes
  • Automatizar workflows web de múltiples pasos (reservas, pedidos, envíos)

El agente puede combinar automatización de navegador con su comprensión del lenguaje — tú describes lo que necesitas en lenguaje natural, y él determina qué botones clickear, qué formularios completar y cómo navegar workflows complejos de múltiples páginas.

Canvas UI

El Canvas UI es una interfaz web opcional que provee interacciones ricas y visuales más allá de lo que las apps de mensajería pueden mostrar. Se conecta al mismo gateway y comparte contexto con tus canales de mensajería, así puedes empezar una conversación en WhatsApp y seguir explorando resultados en el canvas.

Capacidades clave incluyen:

  • Tablas de datos interactivas y listas filtrables para información estructurada
  • Renderizado de gráficos para datos de series temporales, métricas de salud o seguimiento financiero
  • Workflows basados en formularios para entrada de datos multi-paso que es incómoda por chat
  • Paneles de editor de código con resaltado de sintaxis para revisar y editar archivos
  • Previsualización de capturas de pantalla y vistas de diff visual de resultados de automatización de navegador

El canvas es servido por el gateway en un puerto configurable y está protegido por la misma capa de autenticación. Es completamente opcional — tu agente funciona perfectamente solo con canales de mensajería.

Sistema de Hooks

El sistema de hooks de OpenClaw provee extensibilidad basada en eventos. Los hooks te permiten ejecutar lógica personalizada antes o después de eventos clave en el ciclo de vida del agente, sin modificar el código base. Se definen en la configuración del nodo y pueden escribirse en JavaScript o como scripts de shell.

Eventos de hook disponibles incluyen:

  • onMessageReceived — Se dispara antes de que el agente procese un mensaje. Úsalo para logging, filtrado de contenido o sobrescrituras de ruteo
  • onResponseReady — Se dispara después de que el agente genera una respuesta, antes de enviarla. Úsalo para sanitización de output, traducción o analíticas
  • onSkillExecuted — Se dispara después de que un skill se completa. Úsalo para auditorías, seguimiento de costos o encadenamiento de acciones de seguimiento
  • onNodeConnect / onNodeDisconnect — Se dispara cuando un nodo se une o deja el gateway. Úsalo para alertas, lógica de failover o rebalanceo de recursos
  • onCronTick — Se dispara en cada ciclo de evaluación de cron. Úsalo para programación dinámica o supresión condicional de jobs

Los hooks reciben un objeto de contexto con el payload del evento y pueden modificarlo in-place (para pre-hooks) o disparar efectos secundarios (para post-hooks). Se ejecutan sincrónicamente en el orden en que se declaran.

Variables de Entorno y .env

Toda la configuración de infraestructura en OpenClaw se gestiona mediante variables de entorno, típicamente cargadas desde un archivo .env en la raíz del proyecto. Esto mantiene los secretos fuera del control de versiones y hace los deploys portables entre máquinas.

Variables de entorno clave incluyen:

# Core
ANTHROPIC_API_KEY=sk-ant-... # Claude API key
GATEWAY_PORT=3100 # Gateway HTTP/WS port
NODE_ID=msi-laptop-c381e7e7 # Unique node identifier

# Channels
WHATSAPP_TOKEN=... # WhatsApp web bridge token
TELEGRAM_BOT_TOKEN=... # Telegram bot token from @BotFather

# Voice
WHISPER_SERVER_URL=http://localhost:9000 # Local Whisper endpoint
TTS_PROVIDER=qwen3-tts # TTS provider (qwen3-tts, luxtts, openai, google)
TTS_SERVER_URL=http://localhost:8100 # Local TTS endpoint

# Browser
BROWSER_EXEC_PATH=/usr/bin/chromium # Headless Chrome path

# Integrations
ATLASSIAN_TOKEN=... # Jira/Confluence API token
SQLITE_MEMORY_PATH=./memory.db # SQLite memory database path

El archivo .env.example en el repositorio documenta cada variable con valores por defecto y descripciones. Las variables también pueden configurarse directamente en el entorno del shell o a través del gestor de secretos de tu plataforma de deploy.

Emparejamiento de Nodos y Multi-Dispositivo

OpenClaw soporta ejecutar múltiples nodos conectados a un solo gateway. Cada nodo es una máquina (o proceso) separado que se registra con el gateway usando un token de emparejamiento. Esto te permite distribuir cargas de trabajo y capacidades entre dispositivos.

Para emparejar un nuevo nodo:

# On the gateway, generate a pairing token
openclaw gateway pair --generate
# Output: TOKEN=abc123...

# On the new node, register with the gateway
openclaw node pair --token abc123... --gateway wss://your-gateway:3100
# The node is now connected and ready to receive tasks

Cada nodo declara sus capacidades (ej: automatización de navegador, sistema de archivos, procesamiento de audio) durante el registro. El gateway usa esta información para rutear tareas inteligentemente — una tarea de navegador va al nodo con Chromium instalado, una operación de archivos va al nodo con acceso al filesystem.

Los setups multi-dispositivo son útiles para separar responsabilidades: corre tu nodo personal en tu laptop para acceso a archivos locales, y un nodo cloud para disponibilidad permanente y tareas de cómputo pesadas. Ambos nodos comparten la misma identidad de agente y memoria.

Últimas Actualizaciones (2026)

SECURITY

Seguridad Reforzada

Tokens bootstrap para registro seguro de nodos, verificación HMAC resistente a ataques de tiempo para prevenir ataques de canal lateral, y carga automática de plugins implícitos deshabilitada para eliminar riesgos de ejecución de código no confiable.

DOCKER

Mejoras de Docker

Variable de entorno OPENCLAW_TZ para soporte de zona horaria en contenedores, compatibilidad mejorada con Windows para Docker Desktop, y soporte de plugins compilados para arranques en frío más rápidos.

MCP

Chrome DevTools MCP

Modo attach oficial para sesiones de navegador Chrome en vivo vía Model Context Protocol. Inspecciona, depura y automatiza pestañas de navegador en ejecución directamente desde tu agente AI.

PLUGINS

Plugins ContextEngine

Gestión de contexto pluggable con hooks de ciclo de vida. Los plugins ContextEngine personalizados pueden interceptar, transformar y enriquecer el contexto de conversación en cada etapa del pipeline del agente.

PROVIDERS

Nuevos Proveedores AI

Vertex AI, Mistral (embeddings + voz), MiniMax y Tavily ahora incluidos como proveedores de primera clase. Cambia modelos y capacidades sin modificar la configuración de tu agente.

MOBILE

Rediseño de UI Móvil

Configuraciones agrupadas en Android para una configuración más fluida, y un nuevo pager de bienvenida en iOS para onboarding guiado. Ambas plataformas con navegación y accesibilidad mejoradas.

ATTACHMENTS

PDF y Adjuntos

Soporte PDF de primera clase con parsing, resumen y renderizado inline. Adjuntos inline en mensajes, y una API SecretRef más amplia para inyección segura de credenciales en skills.

PERFORMANCE

Rendimiento

Caché de catálogo de modelos para cambio instantáneo de proveedor, carga lazy de skills y plugins en la primera invocación, y optimizaciones del dashboard reduciendo el tiempo de carga inicial hasta un 60%.

MODELS

GPT-5.4 y Modo Rápido

OpenAI GPT-5.4 completo con contexto de 1.05M tokens y 75% en benchmark OSWorld. Modo rápido de sesión para GPT-5.4 y Claude reduce latencia en operaciones sensibles al tiempo.

UI

Mejoras Dashboard v2

UI de control modular con vistas de overview, chat, configuración, agente y sesión. Paleta de comandos, búsqueda, exportación, mensajes fijados. 40% más rápido en setup.

CHANNELS

Ruteo por Topic en Telegram

Aislamiento de agente a nivel de topic en grupos de Telegram. Diferentes agentes por topic. Los bindings persistentes se auto-restauran en Discord y Telegram después de reinicios.

ECOSYSTEM

Stack Extendido de Proveedores AI

Integración xAI Grok. Ollama, vLLM, SGLang en arquitectura de plugins. Descubrimiento propiedad del proveedor para expansión fluida del ecosistema.

v2026.4.9

Dreaming: Memoria AI vía REM Backfilling

Nueva funcionalidad "Dreaming" permite a los agentes AI procesar datos históricos mediante REM backfilling, replicando notas de usuario para formar memorias persistentes. Incluye UI de línea de tiempo del diario, protecciones reforzadas contra SSRF e inyección de ejecución de nodos, evaluación QA de atmósfera de rol y pareamiento Android optimizado.

v2026.4.7

Inferencia, Media y TaskFlows

Nuevas capacidades de inferencia, herramientas de edición de música y video, ramificación y restauración de conversaciones, TaskFlows basados en Webhook, soporte Codex incluido, plugin Active Memory opcional, speech MLX local para Talk Mode y manejo enriquecido de Teams/WhatsApp.

v2026.4.14

Claude Opus 4.7, Gemini TTS y Active Memory

Claude Opus 4.7 como modelo por defecto con comprensión de imágenes integrada. Text-to-speech Gemini en el plugin Google incluido con selección de voz y salida WAV/PCM. Sub-agente Active Memory para enriquecimiento de contexto pre-respuesta con inspección /verbose. Compatibilidad forward GPT-5.4-pro. Tarjeta de estado Model Auth mostrando salud OAuth y presión de rate-limit. 346K+ estrellas en GitHub.

v2026.6.5

Trenes de Release Mensuales y Recuperación Endurecida

OpenClaw pasó a trenes de release mensuales YYYY.M.PATCH, fijando el piso de junio 2026 en v2026.6.5 (9 de junio de 2026). Los resultados de tools MCP ahora normalizan bloques resource_link, resource, audio e imágenes malformadas en el límite de materialización, evitando errores 400 de Anthropic e historial de sesión envenenado. Las sesiones de extended thinking de Anthropic se recuperan tras la expiración del prompt-cache o reinicios del Gateway, la búsqueda web Parallel viene incluida, y los tags de razonamiento se eliminan antes de llegar a los canales de chat.

ECOSYSTEM

Ecosistema e Integración con Frameworks de Agentes

El ecosistema de skills de OpenClaw ahora cuenta con 44K+ skills comunitarios en ClawHub, con 65%+ envolviendo servidores MCP. Contrato estandarizado de setup/secret para todos los canales incluidos. Para orquestación multi-agente más allá de OpenClaw, ve nuestras guías sobre Protocolo A2A, Google ADK, OpenAI Agents SDK, LangGraph y n8n.

Canales Soportados (20+)

OpenClaw ahora soporta 20+ canales de mensajería, convirtiéndolo en uno de los frameworks de agentes AI más versátiles para deployment multi-plataforma. Más allá de WhatsApp y Telegram originales, el sistema de adaptadores de canal ahora incluye: Slack, Discord, Google Chat, Signal, iMessage, BlueBubbles, IRC, Microsoft Teams, Matrix, LINE, Mattermost, Nextcloud Talk, Nostr, Twitch y WebChat. Cada adaptador de canal normaliza las funcionalidades específicas de la plataforma (reacciones, hilos, tipos de archivo, mensajes enriquecidos) al formato de mensaje unificado de OpenClaw.

Despliegue con Docker

OpenClaw soporta builds Docker multi-etapa con imágenes de runtime mínimas. La etapa de build compila TypeScript e instala dependencias, mientras la etapa de runtime usa una imagen base Node.js slim con solo dependencias de producción. Esto reduce significativamente el tamaño de la imagen final, acelera el arranque del contenedor y minimiza la superficie de ataque para despliegues en producción. Se proveen configuraciones Docker Compose para correr el gateway, agente nodo y servicios de voz como un stack coordinado.

Broadcast Multi-Agente

OpenClaw soporta dispatch configurable de broadcast grupal con aislamiento de sesión de observador y deduplicación cross-account. Cuando un agente se agrega a un chat grupal (Telegram, Discord, Slack), el sistema de broadcast asegura que cada mensaje se procese exactamente una vez, incluso cuando múltiples instancias de agente observan el mismo grupo. Las sesiones de observador están aisladas -- cada agente mantiene su propio contexto y memoria para la conversación grupal sin interferir con otros agentes.

La deduplicación cross-account previene respuestas duplicadas cuando el mismo usuario interactúa con el agente desde diferentes cuentas o plataformas. El dispatcher de broadcast rutea mensajes basado en reglas configurables: round-robin, basado en capacidad o ruteo por afinidad. Esto habilita setups multi-agente donde diferentes agentes se especializan en diferentes temas dentro del mismo chat grupal.

Ejemplo Real: Setup de Jose

Jose corre OpenClaw 2026.6.5 en una MSI Raider 18 HX como asistente AI de producción accesible vía WhatsApp y Telegram. Esto no es un demo — es un sistema completamente autónomo con 8 servicios siempre activos, 4 daemons automatizados y 6 modelos AI locales corriendo en una RTX 5090. Acá están los detalles exactos:

HARDWARE

MSI Raider 18 HX ($6,458)

RTX 5090 (24 GB GDDR7, 1824 AI TOPS), Intel Core Ultra 9 285HX, 64 GB DDR5, 6 TB NVMe. Esta máquina corre 8 servicios siempre activos simultáneamente.

SERVICES

8 Servicios systemd

openclaw-containers.service (gateway Docker en puerto 18789), openclaw-node.service (agente nodo "MSI-Laptop"), openclaw-fix-permissions.service (watcher de permisos), whisper-server.service (FastAPI Whisper en puerto 8787), voicebox.service (Qwen3-TTS en puerto 8100), luxtts.service (LuxTTS en puerto 8101). Auto-update diario a las 10 AM COT.

MODELS

Modelos AI y Config

Primario: anthropic/claude-opus-4-7, fallback: openai/gpt-5.4. Canales: WhatsApp + Telegram. Memoria: SQLite. Navegador: Chrome DevTools Protocol con perfiles CDP. Timeout del agente: 1800s (30 min). Sandbox: desactivado (acceso completo al sistema).

VOICE

Pipeline de Voz Local (RTX 5090)

Todo el procesamiento de voz corre localmente en la RTX 5090 — cero llamadas a APIs cloud. STT: Whisper large-v3 vía faster-whisper (CUDA float16). TTS: Qwen3-TTS 1.7B con el perfil de voz de Jose. Clonación de voz: LuxTTS a 150x realtime, salida a 48 kHz. Skills personalizados: voicebox-tts y luxtts-voice-clone.

LOCAL AI

6 Modelos Locales en RTX 5090

Whisper large-v3 (transcripción de audio), Qwen3-TTS 1.7B (text-to-speech), LuxTTS (clonación de voz, 150x realtime), Qwen2.5-VL-7B-AWQ (visión-lenguaje para resolver hCaptcha), Wan 2.1 I2V 14B (generación de video) y Nemotron-nano-8b (fine-tuning LoRA con Unsloth). Todos corriendo vía CUDA en 24 GB GDDR7.

DAEMONS

4 Daemons Automatizados

Tracker de balanza Xiaomi (354 mediciones en 13 meses de recolección automatizada), daemon bancario Davivienda (solver de hCaptcha usando Qwen2.5-VL-7B local vía vLLM), actualizador de tasas de cambio y pipeline de auto-deploy. Todos corren autónomamente en schedules cron vía OpenClaw.

WORKSPACE

Workspace de 165 Archivos

El workspace del agente contiene 165 archivos incluyendo AGENTS.md, SOUL.md, IDENTITY.md, USER.md, TOOLS.md, MEMORY.md y HEARTBEAT.md personalizados. El SOUL.md define un asistente bilingüe (español/inglés) con estilo de comunicación argentino usando conjugación con vos y conciencia contextual profunda de los proyectos de Jose.

ACHIEVEMENT

Run Nocturno de 8 Agentes

8 instancias concurrentes de Claude Code corrieron durante la noche mientras OpenClaw monitoreaba el progreso vía cron cada 15 min. La tarea: verificación de facturación tax-exempt en Perú, Chile y Colombia. Resultado: 3 bugs corregidos, 189 suites de tests (1,740 tests), 11 commits en 7 repos de microservicios.

COST

Inversión Mensual: ~$526

Suscripciones AI: ~$257/mes (Claude Max $200, ChatGPT Pro $20, Gemini Pro $20, Perplexity Pro $204/año). Hardware amortizado: ~$269/mes ($6,458 en ciclo de upgrade de GPU de 24 meses). ROI: 8 agentes concurrentes trabajando toda la noche equivale a 8 devs junior por una noche.

Este setup de producción corre ~$526/mes total (suscripciones AI + amortización de hardware) con todo el procesamiento de voz y visión manejado localmente en la RTX 5090 — cero fees de TTS/STT cloud. El resultado es un asistente AI completamente autónomo que corre 24/7, orquesta sesiones de codeo multi-agente nocturnas y automatiza banca, tracking de salud y deployments.

Más Guías