OpenClaw: Despliega tu Asistente AI Personal en WhatsApp y Telegram
Construye y despliega tu propio asistente AI que vive en WhatsApp y Telegram. Interacción por voz, automatización del navegador, cron jobs, skills personalizados y diseño completo de personalidad con AGENTS.md, SOUL.md y MEMORY.md.
Por Jose Nobile | Actualizado 2026-06-11 | 18 min de lectura
Índice
- ¿Qué es OpenClaw?
- Arquitectura: Gateway, Nodos, Canales
- Instalación y Configuración
- AGENTS.md / SOUL.md / MEMORY.md
- Configuración de WhatsApp y Telegram
- Interacción por Voz
- Desarrollo de Skills
- Cron Jobs y Automatización
- Automatización del Navegador
- Canvas UI
- Sistema de Hooks
- Variables de Entorno y .env
- Emparejamiento de Nodos y Multi-Dispositivo
- Últimas Actualizaciones (2026)
- Ejemplo Real: Setup de Jose
¿Qué es OpenClaw?
OpenClaw es un framework open-source para desplegar asistentes AI personales en plataformas de mensajería. A diferencia de chatbots genéricos, OpenClaw crea un AI persistente con personalidad que te conoce, recuerda contexto entre conversaciones, y puede ejecutar acciones en el mundo real — desde navegar la web hasta gestionar tu calendario.
Está construido sobre una arquitectura distribuida con un gateway central, múltiples nodos (cada uno corriendo en diferentes máquinas), y canales (WhatsApp, Telegram, Slack, etc.). Este diseño significa que tu asistente AI puede correr en tu laptop, un VPS o una Raspberry Pi, y tú interactúas desde cualquier app de mensajería.
Lo que hace único a OpenClaw es su sistema de personalidad. A través de archivos AGENTS.md, SOUL.md y MEMORY.md, defines no solo qué puede hacer tu asistente, sino quién es — su estilo de comunicación, valores, áreas de conocimiento y límites de comportamiento.
Arquitectura: Gateway, Nodos, Canales
Gateway
La capa central de ruteo que conecta canales con nodos. El gateway maneja ruteo de mensajes, autenticación, gestión de sesiones y balanceo de carga. Puede correr como un proceso liviano en cualquier servidor.
Nodos
Ambientes de ejecución donde corre tu agente AI. Cada nodo puede hospedar diferentes capacidades (automatización de navegador, acceso al sistema de archivos, herramientas específicas). Múltiples nodos pueden servir un solo agente para redundancia.
Canales
Integraciones con plataformas de mensajería. WhatsApp (vía WhatsApp Business API o web bridge), Telegram Bot API, Slack y más. Cada adaptador de canal traduce mensajes específicos de la plataforma al formato unificado de OpenClaw.
Voz I/O (Whisper)
Pipeline de audio completo: los mensajes de voz entrantes se transcriben vía un servidor Whisper local o remoto, y las respuestas pueden sintetizarse de vuelta a audio. Casos de uso: interacción manos libres al manejar, dictado de notas y accesibilidad para usuarios que prefieren hablar antes que escribir.
Canvas UI
Una interfaz web opcional tipo canvas para interacciones ricas que van más allá del texto. El canvas renderiza tarjetas interactivas, tablas de datos, gráficos y formularios directamente en el navegador, complementando los canales de mensajería con un espacio de trabajo visual. Casos de uso: vistas de dashboard, gestión de tareas con drag-and-drop y exploración visual de datos.
Emparejamiento de Nodos
Empareja múltiples nodos a un solo gateway intercambiando un token de emparejamiento. Cada dispositivo (laptop, VPS, Raspberry Pi) se registra como un nodo separado con sus propias capacidades. El gateway rutea tareas al mejor nodo disponible. Casos de uso: correr tareas pesadas de navegador en un nodo cloud mientras mantienes acceso a archivos en una máquina local.
La arquitectura soporta múltiples usuarios concurrentes, cada uno con su propia personalidad de agente y memoria. Un solo gateway puede rutear mensajes a diferentes nodos según identidad de usuario, tipo de mensaje o condiciones de carga.
Los nodos se comunican con el gateway vía conexiones WebSocket, habilitando entrega de mensajes en tiempo real y streaming bidireccional para interacciones de voz. El protocolo está diseñado para redes inestables — los mensajes se encolan y reintentan si un nodo se desconecta temporalmente.
Instalación y Configuración
OpenClaw corre en Node.js 24 (recomendado) o 22.16+ y requiere algunas variables de entorno para API keys y credenciales de canales. El proceso de instalación está optimizado para desarrolladores familiarizados con npm:
cd openclaw
npm install
cp .env.example .env # Configure your API keys
npm start
La configuración se divide en dos áreas: infraestructura (puertos del gateway, direcciones de nodos, credenciales de canales) en .env y archivos de configuración del ambiente, y personalidad/comportamiento en los archivos Markdown (AGENTS.md, SOUL.md, MEMORY.md).
API Keys Requeridas
API key de Anthropic (para Claude), token de WhatsApp Business API o web bridge, token de Telegram Bot de @BotFather. Opcional: Whisper local + Qwen3-TTS para voz, Browserbase o Puppeteer local para automatización de navegador.
Configuración de Nodos
Cada nodo define sus capacidades, herramientas disponibles y límites de recursos. Los nodos pueden configurarse para manejar tipos específicos de requests (texto, voz, tareas de navegador) o servir como ejecutores de propósito general.
Setup Multi-Máquina
Para deploys avanzados, corre el gateway en un VPS con IP estática, y los nodos en máquinas locales o instancias cloud. El gateway maneja traversal de NAT y mantiene conexiones vivas entre cambios de red.
AGENTS.md / SOUL.md / MEMORY.md
El sistema de personalidad es lo que transforma un AI genérico en tu asistente personal. Tres archivos Markdown definen el perfil de comportamiento completo:
AGENTS.md
Define las capacidades del agente, herramientas disponibles, registro de skills y límites operacionales. Este es el archivo "qué puede hacer" — listando cada skill, sus condiciones de activación y parámetros de ejecución.
SOUL.md
Define la personalidad del agente, estilo de comunicación, valores y principios de comportamiento. Este es el archivo "quién es" — tono de voz, preferencias de idioma, estilo de humor, nivel de empatía y patrones de respuesta.
MEMORY.md
Memoria persistente que el agente lee y escribe. Contiene preferencias del usuario, interacciones pasadas, datos aprendidos y notas contextuales. El agente actualiza este archivo a medida que aprende sobre ti.
Un SOUL.md bien diseñado transforma la experiencia de usuario dramáticamente. El asistente de Jose habla en español argentino natural, usa conjugación con vos, referencia contexto compartido, y ajusta la formalidad según el tema — las discusiones técnicas son precisas, las conversaciones casuales son cálidas y con humor.
Configuración de WhatsApp y Telegram
La configuración de canales implica configurar la API de la plataforma de mensajería y conectarla a tu gateway de OpenClaw. Cada plataforma tiene diferentes requisitos y capacidades:
Dos opciones: WhatsApp Business API (oficial, requiere verificación Meta Business, soporta mensajes enriquecidos) o web bridge (no oficial, setup más simple, cuenta personal). El web bridge funciona conectándose al protocolo de WhatsApp Web.
Telegram
Crea un bot vía @BotFather, obtén el token, y configúralo en OpenClaw. Telegram soporta teclados inline, subida de archivos, mensajes de voz y chat grupal — todo manejado nativamente por el adaptador del canal Telegram.
Ambos canales soportan texto, mensajes de voz (transcritos vía Whisper o similar), imágenes (analizadas vía modelos de visión) y archivos adjuntos. El adaptador del canal normaliza todos los tipos de mensaje en un formato unificado antes de pasarlos al agente.
Para WhatsApp, los mensajes de voz son particularmente poderosos — puedes hablar naturalmente con tu asistente AI mientras manejas o caminas, y responde con voz sintetizada o texto según tu preferencia.
Interacción por Voz
OpenClaw soporta interacción completa por voz: speech-to-text para mensajes de voz entrantes y text-to-speech para respuestas. El pipeline de voz se integra con múltiples proveedores:
- Speech-to-Text — OpenAI Whisper (local o API), Google Speech-to-Text, o Deepgram para transcripción en tiempo real
- Text-to-Speech — Qwen3-TTS (local, perfiles de voz), LuxTTS (clonación de voz, 150x realtime), OpenAI TTS, o Google TTS para síntesis de respuestas
- Modo voz — Configura el agente para responder siempre con voz, solo al recibir voz, o basado en longitud del mensaje y contexto
Las interacciones por voz se sienten naturales porque el agente mantiene contexto conversacional. Puedes empezar un hilo de voz sobre un tema, cambiar a texto, y el agente continúa la conversación sin problemas entre modalidades.
Desarrollo de Skills
Los skills son los bloques de construcción de las capacidades de tu agente. Cada skill es un módulo autocontenido que el agente puede invocar cuando lo necesita. Los skills van desde simples (consulta del clima) hasta complejos (automatización de navegador de múltiples pasos con extracción de datos).
Búsqueda Web
Busca en la web usando APIs de DuckDuckGo, Google o Brave. El agente resume resultados y puede seguir links para extraer información detallada de páginas específicas.
Gestión de Calendario
Integra con Google Calendar para verificar disponibilidad, crear eventos, enviar invitaciones y proveer briefings diarios. El agente puede negociar horarios de reunión entre zonas horarias.
Operaciones de Archivos
Lee, escribe y gestiona archivos en el sistema de archivos del nodo. Genera reportes, procesa CSVs, crea documentos y envíalos de vuelta por el canal de mensajería.
Monitoreo del Sistema
Verifica salud del servidor, uso de disco, procesos en ejecución y contenedores Docker. Recibe alertas proactivas cuando los recursos superan umbrales y obtén sugerencias de troubleshooting.
Crear un skill personalizado implica definir un esquema de herramienta (nombre, descripción, parámetros) y un handler de ejecución. Los skills se registran en AGENTS.md y pueden declarar dependencias de otros skills o APIs externas.
Cron Jobs y Automatización
El sistema de cron de OpenClaw permite que tu agente ejecute tareas programadas sin interacción del usuario. Los cron jobs se definen en la configuración y pueden disparar cualquier skill o secuencia de skills:
- Briefings diarios — Resumen matutino de clima, calendario, noticias y tareas pendientes enviado a tu WhatsApp
- Recordatorios de salud — Recordatorios de suplementos, alertas de ingesta de agua, avisos de entrenamiento en horarios configurados
- Chequeos de monitoreo — Reportes horarios de salud del servidor, alertas de vencimiento de certificados SSL, monitoreo de uptime
- Recolección de datos — Scrapea precios, rastrea envíos, monitorea niveles de stock y reporta cambios
Los cron jobs usan sintaxis cron estándar y pueden ser condicionales — por ejemplo, solo enviar el briefing matutino en días hábiles, o solo alertar sobre problemas del servidor si el CPU supera 80%.
Automatización del Navegador
La automatización del navegador le da a tu agente la capacidad de interactuar con cualquier sitio web como lo haría un usuario. Construido sobre Puppeteer, el skill de navegador puede navegar páginas, completar formularios, hacer clic en botones, extraer datos y tomar capturas de pantalla.
Casos de uso comunes incluyen:
- Completar formularios repetitivos (portales gubernamentales, registros)
- Extraer datos de sitios web que no tienen APIs
- Monitorear cambios de precios en sitios de e-commerce
- Tomar capturas de pantalla para verificación visual o reportes
- Automatizar workflows web de múltiples pasos (reservas, pedidos, envíos)
El agente puede combinar automatización de navegador con su comprensión del lenguaje — tú describes lo que necesitas en lenguaje natural, y él determina qué botones clickear, qué formularios completar y cómo navegar workflows complejos de múltiples páginas.
Canvas UI
El Canvas UI es una interfaz web opcional que provee interacciones ricas y visuales más allá de lo que las apps de mensajería pueden mostrar. Se conecta al mismo gateway y comparte contexto con tus canales de mensajería, así puedes empezar una conversación en WhatsApp y seguir explorando resultados en el canvas.
Capacidades clave incluyen:
- Tablas de datos interactivas y listas filtrables para información estructurada
- Renderizado de gráficos para datos de series temporales, métricas de salud o seguimiento financiero
- Workflows basados en formularios para entrada de datos multi-paso que es incómoda por chat
- Paneles de editor de código con resaltado de sintaxis para revisar y editar archivos
- Previsualización de capturas de pantalla y vistas de diff visual de resultados de automatización de navegador
El canvas es servido por el gateway en un puerto configurable y está protegido por la misma capa de autenticación. Es completamente opcional — tu agente funciona perfectamente solo con canales de mensajería.
Sistema de Hooks
El sistema de hooks de OpenClaw provee extensibilidad basada en eventos. Los hooks te permiten ejecutar lógica personalizada antes o después de eventos clave en el ciclo de vida del agente, sin modificar el código base. Se definen en la configuración del nodo y pueden escribirse en JavaScript o como scripts de shell.
Eventos de hook disponibles incluyen:
- onMessageReceived — Se dispara antes de que el agente procese un mensaje. Úsalo para logging, filtrado de contenido o sobrescrituras de ruteo
- onResponseReady — Se dispara después de que el agente genera una respuesta, antes de enviarla. Úsalo para sanitización de output, traducción o analíticas
- onSkillExecuted — Se dispara después de que un skill se completa. Úsalo para auditorías, seguimiento de costos o encadenamiento de acciones de seguimiento
- onNodeConnect / onNodeDisconnect — Se dispara cuando un nodo se une o deja el gateway. Úsalo para alertas, lógica de failover o rebalanceo de recursos
- onCronTick — Se dispara en cada ciclo de evaluación de cron. Úsalo para programación dinámica o supresión condicional de jobs
Los hooks reciben un objeto de contexto con el payload del evento y pueden modificarlo in-place (para pre-hooks) o disparar efectos secundarios (para post-hooks). Se ejecutan sincrónicamente en el orden en que se declaran.
Variables de Entorno y .env
Toda la configuración de infraestructura en OpenClaw se gestiona mediante variables de entorno, típicamente cargadas desde un archivo .env en la raíz del proyecto. Esto mantiene los secretos fuera del control de versiones y hace los deploys portables entre máquinas.
Variables de entorno clave incluyen:
ANTHROPIC_API_KEY=sk-ant-... # Claude API key
GATEWAY_PORT=3100 # Gateway HTTP/WS port
NODE_ID=msi-laptop-c381e7e7 # Unique node identifier
# Channels
WHATSAPP_TOKEN=... # WhatsApp web bridge token
TELEGRAM_BOT_TOKEN=... # Telegram bot token from @BotFather
# Voice
WHISPER_SERVER_URL=http://localhost:9000 # Local Whisper endpoint
TTS_PROVIDER=qwen3-tts # TTS provider (qwen3-tts, luxtts, openai, google)
TTS_SERVER_URL=http://localhost:8100 # Local TTS endpoint
# Browser
BROWSER_EXEC_PATH=/usr/bin/chromium # Headless Chrome path
# Integrations
ATLASSIAN_TOKEN=... # Jira/Confluence API token
SQLITE_MEMORY_PATH=./memory.db # SQLite memory database path
El archivo .env.example en el repositorio documenta cada variable con valores por defecto y descripciones. Las variables también pueden configurarse directamente en el entorno del shell o a través del gestor de secretos de tu plataforma de deploy.
Emparejamiento de Nodos y Multi-Dispositivo
OpenClaw soporta ejecutar múltiples nodos conectados a un solo gateway. Cada nodo es una máquina (o proceso) separado que se registra con el gateway usando un token de emparejamiento. Esto te permite distribuir cargas de trabajo y capacidades entre dispositivos.
Para emparejar un nuevo nodo:
openclaw gateway pair --generate
# Output: TOKEN=abc123...
# On the new node, register with the gateway
openclaw node pair --token abc123... --gateway wss://your-gateway:3100
# The node is now connected and ready to receive tasks
Cada nodo declara sus capacidades (ej: automatización de navegador, sistema de archivos, procesamiento de audio) durante el registro. El gateway usa esta información para rutear tareas inteligentemente — una tarea de navegador va al nodo con Chromium instalado, una operación de archivos va al nodo con acceso al filesystem.
Los setups multi-dispositivo son útiles para separar responsabilidades: corre tu nodo personal en tu laptop para acceso a archivos locales, y un nodo cloud para disponibilidad permanente y tareas de cómputo pesadas. Ambos nodos comparten la misma identidad de agente y memoria.
Últimas Actualizaciones (2026)
Seguridad Reforzada
Tokens bootstrap para registro seguro de nodos, verificación HMAC resistente a ataques de tiempo para prevenir ataques de canal lateral, y carga automática de plugins implícitos deshabilitada para eliminar riesgos de ejecución de código no confiable.
Mejoras de Docker
Variable de entorno OPENCLAW_TZ para soporte de zona horaria en contenedores, compatibilidad mejorada con Windows para Docker Desktop, y soporte de plugins compilados para arranques en frío más rápidos.
Chrome DevTools MCP
Modo attach oficial para sesiones de navegador Chrome en vivo vía Model Context Protocol. Inspecciona, depura y automatiza pestañas de navegador en ejecución directamente desde tu agente AI.
Plugins ContextEngine
Gestión de contexto pluggable con hooks de ciclo de vida. Los plugins ContextEngine personalizados pueden interceptar, transformar y enriquecer el contexto de conversación en cada etapa del pipeline del agente.
Nuevos Proveedores AI
Vertex AI, Mistral (embeddings + voz), MiniMax y Tavily ahora incluidos como proveedores de primera clase. Cambia modelos y capacidades sin modificar la configuración de tu agente.
Rediseño de UI Móvil
Configuraciones agrupadas en Android para una configuración más fluida, y un nuevo pager de bienvenida en iOS para onboarding guiado. Ambas plataformas con navegación y accesibilidad mejoradas.
PDF y Adjuntos
Soporte PDF de primera clase con parsing, resumen y renderizado inline. Adjuntos inline en mensajes, y una API SecretRef más amplia para inyección segura de credenciales en skills.
Rendimiento
Caché de catálogo de modelos para cambio instantáneo de proveedor, carga lazy de skills y plugins en la primera invocación, y optimizaciones del dashboard reduciendo el tiempo de carga inicial hasta un 60%.
GPT-5.4 y Modo Rápido
OpenAI GPT-5.4 completo con contexto de 1.05M tokens y 75% en benchmark OSWorld. Modo rápido de sesión para GPT-5.4 y Claude reduce latencia en operaciones sensibles al tiempo.
Mejoras Dashboard v2
UI de control modular con vistas de overview, chat, configuración, agente y sesión. Paleta de comandos, búsqueda, exportación, mensajes fijados. 40% más rápido en setup.
Ruteo por Topic en Telegram
Aislamiento de agente a nivel de topic en grupos de Telegram. Diferentes agentes por topic. Los bindings persistentes se auto-restauran en Discord y Telegram después de reinicios.
Stack Extendido de Proveedores AI
Integración xAI Grok. Ollama, vLLM, SGLang en arquitectura de plugins. Descubrimiento propiedad del proveedor para expansión fluida del ecosistema.
Dreaming: Memoria AI vía REM Backfilling
Nueva funcionalidad "Dreaming" permite a los agentes AI procesar datos históricos mediante REM backfilling, replicando notas de usuario para formar memorias persistentes. Incluye UI de línea de tiempo del diario, protecciones reforzadas contra SSRF e inyección de ejecución de nodos, evaluación QA de atmósfera de rol y pareamiento Android optimizado.
Inferencia, Media y TaskFlows
Nuevas capacidades de inferencia, herramientas de edición de música y video, ramificación y restauración de conversaciones, TaskFlows basados en Webhook, soporte Codex incluido, plugin Active Memory opcional, speech MLX local para Talk Mode y manejo enriquecido de Teams/WhatsApp.
Claude Opus 4.7, Gemini TTS y Active Memory
Claude Opus 4.7 como modelo por defecto con comprensión de imágenes integrada. Text-to-speech Gemini en el plugin Google incluido con selección de voz y salida WAV/PCM. Sub-agente Active Memory para enriquecimiento de contexto pre-respuesta con inspección /verbose. Compatibilidad forward GPT-5.4-pro. Tarjeta de estado Model Auth mostrando salud OAuth y presión de rate-limit. 346K+ estrellas en GitHub.
Trenes de Release Mensuales y Recuperación Endurecida
OpenClaw pasó a trenes de release mensuales YYYY.M.PATCH, fijando el piso de junio 2026 en v2026.6.5 (9 de junio de 2026). Los resultados de tools MCP ahora normalizan bloques resource_link, resource, audio e imágenes malformadas en el límite de materialización, evitando errores 400 de Anthropic e historial de sesión envenenado. Las sesiones de extended thinking de Anthropic se recuperan tras la expiración del prompt-cache o reinicios del Gateway, la búsqueda web Parallel viene incluida, y los tags de razonamiento se eliminan antes de llegar a los canales de chat.
Ecosistema e Integración con Frameworks de Agentes
El ecosistema de skills de OpenClaw ahora cuenta con 44K+ skills comunitarios en ClawHub, con 65%+ envolviendo servidores MCP. Contrato estandarizado de setup/secret para todos los canales incluidos. Para orquestación multi-agente más allá de OpenClaw, ve nuestras guías sobre Protocolo A2A, Google ADK, OpenAI Agents SDK, LangGraph y n8n.
Canales Soportados (20+)
OpenClaw ahora soporta 20+ canales de mensajería, convirtiéndolo en uno de los frameworks de agentes AI más versátiles para deployment multi-plataforma. Más allá de WhatsApp y Telegram originales, el sistema de adaptadores de canal ahora incluye: Slack, Discord, Google Chat, Signal, iMessage, BlueBubbles, IRC, Microsoft Teams, Matrix, LINE, Mattermost, Nextcloud Talk, Nostr, Twitch y WebChat. Cada adaptador de canal normaliza las funcionalidades específicas de la plataforma (reacciones, hilos, tipos de archivo, mensajes enriquecidos) al formato de mensaje unificado de OpenClaw.
Despliegue con Docker
OpenClaw soporta builds Docker multi-etapa con imágenes de runtime mínimas. La etapa de build compila TypeScript e instala dependencias, mientras la etapa de runtime usa una imagen base Node.js slim con solo dependencias de producción. Esto reduce significativamente el tamaño de la imagen final, acelera el arranque del contenedor y minimiza la superficie de ataque para despliegues en producción. Se proveen configuraciones Docker Compose para correr el gateway, agente nodo y servicios de voz como un stack coordinado.
Broadcast Multi-Agente
OpenClaw soporta dispatch configurable de broadcast grupal con aislamiento de sesión de observador y deduplicación cross-account. Cuando un agente se agrega a un chat grupal (Telegram, Discord, Slack), el sistema de broadcast asegura que cada mensaje se procese exactamente una vez, incluso cuando múltiples instancias de agente observan el mismo grupo. Las sesiones de observador están aisladas -- cada agente mantiene su propio contexto y memoria para la conversación grupal sin interferir con otros agentes.
La deduplicación cross-account previene respuestas duplicadas cuando el mismo usuario interactúa con el agente desde diferentes cuentas o plataformas. El dispatcher de broadcast rutea mensajes basado en reglas configurables: round-robin, basado en capacidad o ruteo por afinidad. Esto habilita setups multi-agente donde diferentes agentes se especializan en diferentes temas dentro del mismo chat grupal.
Ejemplo Real: Setup de Jose
Jose corre OpenClaw 2026.6.5 en una MSI Raider 18 HX como asistente AI de producción accesible vía WhatsApp y Telegram. Esto no es un demo — es un sistema completamente autónomo con 8 servicios siempre activos, 4 daemons automatizados y 6 modelos AI locales corriendo en una RTX 5090. Acá están los detalles exactos:
MSI Raider 18 HX ($6,458)
RTX 5090 (24 GB GDDR7, 1824 AI TOPS), Intel Core Ultra 9 285HX, 64 GB DDR5, 6 TB NVMe. Esta máquina corre 8 servicios siempre activos simultáneamente.
8 Servicios systemd
openclaw-containers.service (gateway Docker en puerto 18789), openclaw-node.service (agente nodo "MSI-Laptop"), openclaw-fix-permissions.service (watcher de permisos), whisper-server.service (FastAPI Whisper en puerto 8787), voicebox.service (Qwen3-TTS en puerto 8100), luxtts.service (LuxTTS en puerto 8101). Auto-update diario a las 10 AM COT.
Modelos AI y Config
Primario: anthropic/claude-opus-4-7, fallback: openai/gpt-5.4. Canales: WhatsApp + Telegram. Memoria: SQLite. Navegador: Chrome DevTools Protocol con perfiles CDP. Timeout del agente: 1800s (30 min). Sandbox: desactivado (acceso completo al sistema).
Pipeline de Voz Local (RTX 5090)
Todo el procesamiento de voz corre localmente en la RTX 5090 — cero llamadas a APIs cloud. STT: Whisper large-v3 vía faster-whisper (CUDA float16). TTS: Qwen3-TTS 1.7B con el perfil de voz de Jose. Clonación de voz: LuxTTS a 150x realtime, salida a 48 kHz. Skills personalizados: voicebox-tts y luxtts-voice-clone.
6 Modelos Locales en RTX 5090
Whisper large-v3 (transcripción de audio), Qwen3-TTS 1.7B (text-to-speech), LuxTTS (clonación de voz, 150x realtime), Qwen2.5-VL-7B-AWQ (visión-lenguaje para resolver hCaptcha), Wan 2.1 I2V 14B (generación de video) y Nemotron-nano-8b (fine-tuning LoRA con Unsloth). Todos corriendo vía CUDA en 24 GB GDDR7.
4 Daemons Automatizados
Tracker de balanza Xiaomi (354 mediciones en 13 meses de recolección automatizada), daemon bancario Davivienda (solver de hCaptcha usando Qwen2.5-VL-7B local vía vLLM), actualizador de tasas de cambio y pipeline de auto-deploy. Todos corren autónomamente en schedules cron vía OpenClaw.
Workspace de 165 Archivos
El workspace del agente contiene 165 archivos incluyendo AGENTS.md, SOUL.md, IDENTITY.md, USER.md, TOOLS.md, MEMORY.md y HEARTBEAT.md personalizados. El SOUL.md define un asistente bilingüe (español/inglés) con estilo de comunicación argentino usando conjugación con vos y conciencia contextual profunda de los proyectos de Jose.
Run Nocturno de 8 Agentes
8 instancias concurrentes de Claude Code corrieron durante la noche mientras OpenClaw monitoreaba el progreso vía cron cada 15 min. La tarea: verificación de facturación tax-exempt en Perú, Chile y Colombia. Resultado: 3 bugs corregidos, 189 suites de tests (1,740 tests), 11 commits en 7 repos de microservicios.
Inversión Mensual: ~$526
Suscripciones AI: ~$257/mes (Claude Max $200, ChatGPT Pro $20, Gemini Pro $20, Perplexity Pro $204/año). Hardware amortizado: ~$269/mes ($6,458 en ciclo de upgrade de GPU de 24 meses). ROI: 8 agentes concurrentes trabajando toda la noche equivale a 8 devs junior por una noche.
Este setup de producción corre ~$526/mes total (suscripciones AI + amortización de hardware) con todo el procesamiento de voz y visión manejado localmente en la RTX 5090 — cero fees de TTS/STT cloud. El resultado es un asistente AI completamente autónomo que corre 24/7, orquesta sesiones de codeo multi-agente nocturnas y automatiza banca, tracking de salud y deployments.