AI INFERENCE

Guía de Inferencia AI: Cada Modelo, Proveedor y Precio Comparado

La comparación definitiva de cada opción importante de inferencia AI — desde servicios API hasta despliegue local. Filtra por modalidad, encuentra alternativas a cualquier modelo, compara precios y verifica requerimientos de VRAM.

Por Jose Nobile | 2026-07-01 | 25 min de lectura

Introducción

El panorama de inferencia AI en julio de 2026 es vasto y fragmentado. Docenas de proveedores ofrecen cientos de modelos en generación de texto, código, imágenes, video, voz y música. Los precios cambian semanalmente. Se lanzan modelos nuevos a diario. Hacer seguimiento de qué está disponible, cuánto cuesta y si puedes correrlo localmente es un trabajo de tiempo completo.

Esta guía resuelve ese problema. Usa el Buscador Interactivo de Modelos de abajo para filtrar por categoría, ordenar por precio o calidad, y encontrar alternativas a cualquier modelo al instante — con puntajes de calidad relativos, comparaciones de precios y requerimientos de despliegue local. Más abajo encontrarás tablas completas de proveedores API, servicios de suscripción, software de despliegue local, requerimientos de VRAM y rankings de calidad.

Todos los datos de precios reflejan tarifas publicadas a julio 2026. Los precios son por millón de tokens (MTok) para modelos de texto, por imagen para generadores de imágenes, por minuto para audio y por segundo para video. Los rankings usan puntajes normalizados de Artificial Analysis, LMSYS Arena, HumanEval y MMLU.

Fine-tuning e inferencia están convergiendo. Herramientas como Unsloth ahora sirven tanto como frameworks de fine-tuning como motores de inferencia — puedes entrenar un adaptador LoRA/QLoRA con GRPO o DPO, exportar a GGUF o vLLM, y correr el resultado localmente con la misma herramienta. Unsloth proporciona notebooks gratuitos de Google Colab para Gemma 4 que corren en una GPU T4 con solo 8 GB de VRAM, entrenando 1.5x más rápido y usando 50% menos memoria que los métodos estándar. Para despliegue en producción, los adaptadores LoRA fine-tuneados se pueden servir en Cloudflare Workers AI (beta abierta, soporta modelos base Mistral/Gemma/Llama) o a través de vLLM y Ollama. Consulta la guía de formación para servicios de fine-tuning.

Consejo: Haz clic en cualquier tarjeta de modelo para expandir su panel de detalles con proveedores, rendimiento GPU, compatibilidad de engines, benchmarks y alternativas.

Novedades de abril 2026: Claude Opus 4.7 se lanzó el 16 de abril con un nivel de esfuerzo xhigh, presupuestos de tareas para cargas autónomas y visión de 2,576px — al mismo precio de $5/$25 por MTok que Opus 4.6. OpenAI lanzó GPT-5.4 (5 de marzo) con uso integrado de computadora y una reducción del 33% en errores factuales; GPT-5.4 Thinking lidera LMSYS Arena. Anthropic eliminó los recargos por contexto largo el 13 de marzo — una solicitud de 900K tokens con Opus ahora cuesta la misma tarifa por token que una de 9K tokens. La herramienta advisor de Anthropic (beta, 9 de abril) empareja Sonnet como ejecutor con Opus como advisor, obteniendo 74.8% en SWE-bench Multilingual y costando 11.9% menos que Opus solo. La facturación enterprise cambió a puro uso el 16 de abril, eliminando los tokens incluidos en suscripciones. Actualización julio 2026: el flagship de Anthropic ahora es Claude Opus 4.8 (28 de mayo, mismo precio de $5/$25 por MTok que Opus 4.7, contexto de 1M), y Claude Sonnet 5 (30 de junio) es el nuevo modelo por defecto en Free/Pro con precio introductorio de $2/$10 hasta el 31 de agosto (luego $3/$15). Gemini 3.5 Flash de Google (19 de mayo) supera a Gemini 3.1 Pro en código a $1.50/$9. DeepSeek publicó los pesos abiertos V4 Pro (1.6T MoE) y V4 Flash bajo licencia MIT. OpenAI dio preview a la familia GPT-5.6 (Sol/Terra/Luna, 26 de junio) a un grupo reducido de socios. Alibaba añadió Qwen3.7 Max y Qwen3.7 Plus, ambos propietarios.

Buscador Interactivo de Modelos

Filtra por categoría, ordena por cualquier métrica y haz clic en cualquier tarjeta para ver proveedores detallados, rendimiento GPU, compatibilidad de engines y alternativas.

Todos Texto / Chat Código Gen. Imágenes Gen. Video Voz a Texto Texto a Voz Embeddings Música Multimodal Vision/OCR
Rankings:

Compuesto = promedio de puntaje entre benchmarks activos. Activa o desactiva benchmarks para ver cómo cambian los rankings.

Comparación de Proveedores API

Click any model in the finder to see every API provider, pricing, cache discounts, and free tiers side by side.

Explore providers in the interactive finder above ↑

Servicios de Suscripción

The finder includes full subscription tier details -- token economics, value ratios, and model access -- for ChatGPT, Claude, Gemini, Perplexity, and more.

Explore subscriptions in the interactive finder above ↑

Opciones de Despliegue Local

Filter by "Localhost Only" in the finder to see every model you can run locally, with engine compatibility (Ollama, vLLM, llama.cpp, LM Studio, and more).

Explore local models in the interactive finder above ↑

Requerimientos de VRAM

Sort by VRAM in the finder to see memory requirements at Q4, Q8, and FP16 for every local model, with recommended GPU pairings.

Explore VRAM requirements in the interactive finder above ↑

Guía de Compra y Alquiler de GPU

Click any model card to see GPU performance data, consumer GPU pricing, and cloud rental rates from every major provider.

Explore GPU options in the interactive finder above ↑

Rendimiento de Modelos por GPU

Each model card's detail panel shows real-world tok/s benchmarks across consumer and datacenter GPUs.

Explore GPU performance in the interactive finder above ↑

Rankings

Use the benchmark toggles in the finder to see rankings from LMSYS Arena, HumanEval, SWE-bench, MMLU-Pro, GPQA Diamond, and more. Toggle individual benchmarks to see how composite scores change.

Explore rankings in the interactive finder above ↑