Elegir modelo era antes una preferencia de ingeniería. En 2026 es una decisión de gobernanza y de cuenta de resultados — sobre todo para operadores que hacen correr agentes sobre volumen real. Este artículo expone el cálculo de coste que usamos con clientes: modelos de pesos abiertos por defecto, frontier cuando se lo ganan, con cifras etiquetadas como ilustrativas salvo que estén ligadas a tarifas publicadas.
Para el contexto de arquitectura, lee la página de la stack híbrida abierta y nuestro artículo sobre la elección de modelo como decisión de gobernanza.
Dos categorías, una sola capa de enrutado
| Categoría | Ejemplos | Carga típica |
|---|---|---|
| Núcleo de pesos abiertos | Llama, Mistral, Qwen, clase GLM | Triaje, etiquetado, extracción, borradores estándar, alto volumen |
| APIs frontier | Claude, GPT, Gemini | Cadenas complejas, tono delicado, razonamiento ambiguo multi-paso |
El error es elegir un solo proveedor para todo. La disciplina es el enrutado por llamada con registro — para lo que está construida la Capa Operativa de IA.
Economía ilustrativa por llamada
Los precios de los proveedores cambian cada semana; trata la tabla como orden de magnitud, a verificar antes de presupuestar:
| Clase de tarea | Enrutado open (ilustrativo) | Enrutado frontier (ilustrativo) | Ratio |
|---|---|---|---|
| Clasificación de un solo paso | $/1M tokens bajo | $/1M tokens medio | ~3–5× |
| Resumen de hilo largo | Medio | Alto | ~4–8× |
| Cadena de pasos de agente multi-herramienta | Medio-alto | Alto | ~6–12× |
Nuestro contenido de producto usa ~6–12× como referencia de stack híbrida cuando el mismo flujo se enruta enteramente a frontier frente a un modelo abierto bien elegido para el grueso de las llamadas — no es una promesa en tu factura.
El cálculo de coste combinado (~80/20)
Supón un flujo con 10.000 llamadas de modelo al mes, coste normalizado de 1 unidad por llamada open y 8 unidades por llamada frontier (8× ilustrativo):
| Estrategia | Cálculo | Coste de inferencia relativo |
|---|---|---|
| 100 % open | 10.000 × 1 | 10.000 |
| 100 % frontier | 10.000 × 8 | 80.000 |
| 80 % open / 20 % frontier | 8.000×1 + 2.000×8 | 24.000 (~70 % por debajo del todo-frontier) |
Las mezclas reales dependen de qué pasos merecen de verdad el frontier. A finanzas le importa la línea combinada, no la demo que solo usó el modelo premium.
Residencia de datos y la opción abierta
Las APIs frontier a menudo implican que los datos salen de tu región elegida bajo condiciones del proveedor. Los modelos abiertos capaces pueden correr:
- En tu propio tenant cloud (UE, Reino Unido, EE. UU. según se acuerde)
- Vía proveedores de inferencia alojados en la UE
- On-prem donde el capital y la operación lo justifiquen
La residencia no es gratis — pero es elegible de una forma en la que los valores por defecto frontier de un solo proveedor a veces no lo son. Eso importa para datos de huéspedes en hostelería, RR. HH. y flujos cercanos a salud.
Cuándo gana el frontier (lista honesta)
Enruta hacia APIs premium cuando se cumple la mayoría o todo esto:
- Más de tres pasos de herramientas dependientes con coste de fallo
- Riesgo de tono reputacional (reclamación, comunicación B2B ejecutiva)
- Ambigüedad donde una mala clasificación cuesta más que la diferencia de tokens
- La evaluación muestra que el modelo abierto no alcanza la precisión acordada en casos representativos
Si nada de esto aplica, el open suele ser la respuesta correcta por defecto — demuéstralo en las evaluaciones del piloto, no en el marketing del proveedor.
Cuándo gana el open
- Clasificación y etiquetado de alto volumen
- Extracción estructurada con validación humana en excepciones
- Borradores estándar desde plantillas aprobadas
- Primer filtro con open, luego una «pasada de revisión» frontier más pequeña sobre casos difíciles
Patrón: primer paso open, segundo paso frontier en los elementos marcados — reduce el coste sin esconder los casos difíciles.
Requisitos operativos (poco glamurosos, obligatorios)
Enrutar sin observabilidad es adivinar:
- Registra modelo, tokens, coste estimado y nombre de herramienta por llamada
- Un panel o una exportación semanal que finanzas pueda leer
- Métricas de la cola de revisión (tasa de aprobación, tasa de corrección) ligadas a cambios de modelo
- Vuelve a correr el conjunto de evaluación cuando cambien prompts, herramientas o modelos
Es el mismo listón que fijamos en los proyectos de gobernanza de IA — la elección de modelo es un objeto de política, no un secreto de desarrollador.
El coste en la pizarra antes del piloto
Discovery debe producir:
- Un diagrama de flujo con la asignación de modelo por paso
- Una banda de inferencia mensual ilustrativa (open, frontier, combinada)
- Criterios para promover un paso a frontier o degradarlo a open tras revisión
Puntos de partida publicados del proyecto (no de inferencia): Discovery 1.950 €, piloto desde 4.800 €.
Errores habituales
- Todo frontier porque la demo parecía más inteligente — la factura escala linealmente con el volumen.
- Todo open en borradores externos sensibles al tono — el trabajo de corrección se come el ahorro.
- Sin conjunto de evaluación — descubres el fallo en la semana tres de temporada, no en el laboratorio.
- Enrutado solo en los prompts — sin registros de gateway, finanzas y seguridad no pueden auditar.
Si la economía de modelos bloquea tu caso de negocio, pide presupuesto de paquete o lee la página de la stack abierta, que se mantiene como contexto.
Preguntas frecuentes
¿Los modelos abiertos son suficientemente buenos para agentes en producción?
Para clasificación, extracción y borradores estándar — a menudo sí, cuando las herramientas y la evaluación están bien diseñadas. Los modelos frontier se ganan su lugar en razonamiento complejo, tono delicado o cadenas de herramientas largas y dependientes — no en cada llamada por defecto.
¿Cuál es un reparto realista entre open y frontier?
Patrón de diseño ilustrativo: ~80 % open / ~20 % frontier por volumen de llamadas puede quedar ~70 % por debajo de la inferencia todo-frontier para una carga similar — no es un ahorro garantizado; depende de la mezcla de tareas y de la disciplina de enrutado.
¿Autohospedar modelos abiertos elimina el coste?
Cambia la curva: sin factura por token del proveedor, pero con capital de GPU/hosting y operación. Los equipos mid-market suelen empezar con APIs abiertas alojadas en una región acordada, y evalúan el autohospedaje después si el volumen lo justifica.
¿Cómo decidimos por flujo de trabajo?
Discovery mapea sensibilidad, latencia, idioma y coste de error. Pon la elección de modelo por flujo y la inferencia mensual esperada en la pizarra antes del piloto — la misma disciplina que describimos en la página de producto de la stack abierta.
