Guía de Inferencia AI: Cada Modelo, Proveedor y Precio Comparado
La comparación definitiva de cada opción importante de inferencia AI — desde servicios API hasta despliegue local. Filtra por modalidad, encuentra alternativas a cualquier modelo, compara precios y verifica requerimientos de VRAM.
Por Jose Nobile | 2026-07-01 | 25 min de lectura
Índice
- Introducción
- Buscador Interactivo de Modelos
- Comparación de Proveedores API(via Finder)
- Servicios de Suscripción(via Finder)
- Opciones de Despliegue Local(via Finder)
- Requerimientos de VRAM(via Finder)
- Guía de Compra y Alquiler de GPU(via Finder)
- Rendimiento de Modelos por GPU(via Finder)
- Rankings(via Finder)
- Guías Relacionadas
Introducción
El panorama de inferencia AI en julio de 2026 es vasto y fragmentado. Docenas de proveedores ofrecen cientos de modelos en generación de texto, código, imágenes, video, voz y música. Los precios cambian semanalmente. Se lanzan modelos nuevos a diario. Hacer seguimiento de qué está disponible, cuánto cuesta y si puedes correrlo localmente es un trabajo de tiempo completo.
Esta guía resuelve ese problema. Usa el Buscador Interactivo de Modelos de abajo para filtrar por categoría, ordenar por precio o calidad, y encontrar alternativas a cualquier modelo al instante — con puntajes de calidad relativos, comparaciones de precios y requerimientos de despliegue local. Más abajo encontrarás tablas completas de proveedores API, servicios de suscripción, software de despliegue local, requerimientos de VRAM y rankings de calidad.
Todos los datos de precios reflejan tarifas publicadas a julio 2026. Los precios son por millón de tokens (MTok) para modelos de texto, por imagen para generadores de imágenes, por minuto para audio y por segundo para video. Los rankings usan puntajes normalizados de Artificial Analysis, LMSYS Arena, HumanEval y MMLU.
Fine-tuning e inferencia están convergiendo. Herramientas como Unsloth ahora sirven tanto como frameworks de fine-tuning como motores de inferencia — puedes entrenar un adaptador LoRA/QLoRA con GRPO o DPO, exportar a GGUF o vLLM, y correr el resultado localmente con la misma herramienta. Unsloth proporciona notebooks gratuitos de Google Colab para Gemma 4 que corren en una GPU T4 con solo 8 GB de VRAM, entrenando 1.5x más rápido y usando 50% menos memoria que los métodos estándar. Para despliegue en producción, los adaptadores LoRA fine-tuneados se pueden servir en Cloudflare Workers AI (beta abierta, soporta modelos base Mistral/Gemma/Llama) o a través de vLLM y Ollama. Consulta la guía de formación para servicios de fine-tuning.
Consejo: Haz clic en cualquier tarjeta de modelo para expandir su panel de detalles con proveedores, rendimiento GPU, compatibilidad de engines, benchmarks y alternativas.
Novedades de abril 2026: Claude Opus 4.7 se lanzó el 16 de abril con un nivel de esfuerzo xhigh, presupuestos de tareas para cargas autónomas y visión de 2,576px — al mismo precio de $5/$25 por MTok que Opus 4.6. OpenAI lanzó GPT-5.4 (5 de marzo) con uso integrado de computadora y una reducción del 33% en errores factuales; GPT-5.4 Thinking lidera LMSYS Arena. Anthropic eliminó los recargos por contexto largo el 13 de marzo — una solicitud de 900K tokens con Opus ahora cuesta la misma tarifa por token que una de 9K tokens. La herramienta advisor de Anthropic (beta, 9 de abril) empareja Sonnet como ejecutor con Opus como advisor, obteniendo 74.8% en SWE-bench Multilingual y costando 11.9% menos que Opus solo. La facturación enterprise cambió a puro uso el 16 de abril, eliminando los tokens incluidos en suscripciones. Actualización julio 2026: el flagship de Anthropic ahora es Claude Opus 4.8 (28 de mayo, mismo precio de $5/$25 por MTok que Opus 4.7, contexto de 1M), y Claude Sonnet 5 (30 de junio) es el nuevo modelo por defecto en Free/Pro con precio introductorio de $2/$10 hasta el 31 de agosto (luego $3/$15). Gemini 3.5 Flash de Google (19 de mayo) supera a Gemini 3.1 Pro en código a $1.50/$9. DeepSeek publicó los pesos abiertos V4 Pro (1.6T MoE) y V4 Flash bajo licencia MIT. OpenAI dio preview a la familia GPT-5.6 (Sol/Terra/Luna, 26 de junio) a un grupo reducido de socios. Alibaba añadió Qwen3.7 Max y Qwen3.7 Plus, ambos propietarios.
Buscador Interactivo de Modelos
Filtra por categoría, ordena por cualquier métrica y haz clic en cualquier tarjeta para ver proveedores detallados, rendimiento GPU, compatibilidad de engines y alternativas.
Compuesto = promedio de puntaje entre benchmarks activos. Activa o desactiva benchmarks para ver cómo cambian los rankings.
Comparación de Proveedores API
Click any model in the finder to see every API provider, pricing, cache discounts, and free tiers side by side.
Servicios de Suscripción
The finder includes full subscription tier details -- token economics, value ratios, and model access -- for ChatGPT, Claude, Gemini, Perplexity, and more.
Opciones de Despliegue Local
Filter by "Localhost Only" in the finder to see every model you can run locally, with engine compatibility (Ollama, vLLM, llama.cpp, LM Studio, and more).
Requerimientos de VRAM
Sort by VRAM in the finder to see memory requirements at Q4, Q8, and FP16 for every local model, with recommended GPU pairings.
Guía de Compra y Alquiler de GPU
Click any model card to see GPU performance data, consumer GPU pricing, and cloud rental rates from every major provider.
Rendimiento de Modelos por GPU
Each model card's detail panel shows real-world tok/s benchmarks across consumer and datacenter GPUs.
Rankings
Use the benchmark toggles in the finder to see rankings from LMSYS Arena, HumanEval, SWE-bench, MMLU-Pro, GPQA Diamond, and more. Toggle individual benchmarks to see how composite scores change.