Solución de captchas a costo casi cero con un modelo de visión local
Monitor de portal bancario — proyecto personal
- Problema
- Un monitor de portal chocaba constantemente con retos de hCaptcha. Resolver cada uno con una API de visión en la nube habría significado una factura medida y sin tope para una tarea que corre en horario, de forma indefinida.
- Enfoque
- Construí un solucionador local-first: un modelo de visión Qwen3-VL cuantizado corriendo en GPU vía exllamav3, envuelto en un caché jerárquico para que los retos repetidos nunca vuelvan a inferir. Solo los casos raros en que el modelo local duda escalan a Claude visión. Comparé motores cara a cara (exllamav3 vs llama.cpp vs vLLM) con igual precisión para elegir el más rápido.
- Resultado
- El motor ganador resolvió un reto en ~335 ms en hardware local — cerca de 3x más rápido que las alternativas con la misma precisión — y el caché más la inferencia local redujeron a casi cero el costo recurrente de API en la nube para resolver captchas.
- Stack
Qwen3-VL-8Bexllamav3 (EXL3 4bpw)llama.cppClaude vision escalationPythonhierarchical cacheRTX 5090