Bring your own key

Con BYOK pagas la inferencia
a lo que cuesta, no a lo que te cobran.

La idea es simple: en vez de comprarle créditos a una herramienta, pones tu propia llave del proveedor y la factura de inferencia te llega a ti, al precio de tarifa. Lo que casi nadie explica es cuándo sale a cuenta y cuándo no — porque no siempre sale.

Precios tomados de la tarifa oficial de cada proveedor · 17 de agosto de 2026

Qué compra cada modelo de precio

BYOK no elimina el coste de la IA: lo mueve de sitio

Una herramienta de IA te cobra por dos cosas distintas, aunque casi siempre las presente juntas en un solo precio: el software —la interfaz, la orquestación, lo que hayan construido— y la inferencia, que es lo que cuesta que un modelo lea tu texto y escriba una respuesta.

En el modelo de créditos, pagas las dos a la misma empresa y ella le paga al proveedor del modelo. La diferencia entre lo que te cobra y lo que paga es su margen, y normalmente no lo publica.

En BYOK sólo le pagas el software. La inferencia la contratas tú directamente con Anthropic, OpenAI, Google o quien elijas, y te la facturan a la misma tarifa pública que a cualquiera. La herramienta enruta tus peticiones con tu llave y no toca esa parte.

Dicho de otra forma: BYOK no es un descuento, es quitar un intermediario. Si consumes poco, ese intermediario puede estar subvencionándote; si consumes mucho, te está cobrando de más. El punto donde se cruzan las dos curvas es toda la decisión.

Lo que BYOK no te da: un tope de gasto. Una suscripción con créditos se acaba y deja de funcionar; una llave propia sigue facturando mientras haya peticiones. Si vas a dejar agentes corriendo solos, pon un límite de gasto en el panel del proveedor antes de la primera noche, no después.

Cifras, no adjetivos

Lo que cuesta un millón de tokens hoy

Tarifa pública de cada proveedor, consultada en su propia página de precios el 17 de agosto de 2026. Estos números cambian; si vas a decidir con ellos, compruébalos en la fuente antes.

Modelo Entrada / 1M Salida / 1M Para qué lo usarías
Claude Opus 5 $5 $25 Trabajo agéntico largo y código difícil
Claude Sonnet 5 $2 $10 El equilibrio para el día a día
Claude Haiku 4.5 $1 $5 Tareas cortas y clasificación
GPT-5.6 Sol $5 $30 El tope de gama de OpenAI
GPT-5.6 Terra $2 $12 Gama media de OpenAI
GPT-5.6 Luna $0.20 $1.20 Volumen alto y coste bajo
Modelo local con Ollama $0 $0 Sin factura de tokens; se paga en hardware y en calidad

La salida cuesta entre cinco y seis veces más que la entrada en casi todos los proveedores, y en trabajo agéntico la entrada domina el consumo: cada paso reenvía el contexto acumulado. Por eso una estimación hecha sobre un chat corto se queda muy por debajo de lo que gasta un agente que trabaja una hora.

La parte que nadie publica

Cuándo BYOK te ahorra y cuándo te complica

Depende de una sola variable: cuánto consumes. Todo lo demás es secundario.

Sale a cuenta

Consumo alto o irregular

Si dejas agentes trabajando horas, o tienes semanas de mucho uso y semanas de nada, el precio plano más tarifa de proveedor casi siempre gana. Los planes con créditos se dimensionan para el usuario medio, y el uso agéntico no es medio.

Sale a cuenta

Ya pagas una suscripción de agente

Si ya tienes Claude Code o Codex, esa cuota incluye inferencia que estás usando a medias. Una herramienta que entra con tu sesión en vez de pedirte una llave nueva no te añade coste ninguno.

Sale a cuenta

Quieres elegir el modelo por tarea

Con llave propia puedes mandar lo barato a un modelo pequeño y lo difícil a uno grande. En un sistema de créditos esa decisión la toma el proveedor, y normalmente no en tu favor.

No sale a cuenta

Uso ligero y ocasional

Unas cuantas preguntas a la semana caben de sobra en el plan gratuito de casi cualquier herramienta. Añadir una llave, una tarjeta y un panel de facturación más para eso es trabajo sin retorno.

No sale a cuenta

No quieres administrar llaves

Una llave es una credencial: hay que guardarla, rotarla y vigilar su gasto. Si eres un equipo sin nadie que se ocupe de eso, el margen que paga el modelo de créditos compra algo real.

No sale a cuenta

Necesitas gasto previsible al céntimo

Con créditos sabes exactamente el máximo del mes porque es la cuota. Con BYOK el máximo lo pones tú en el panel del proveedor, y si se te olvida no hay máximo.

El panorama, no un anuncio

Formas de trabajar con tu propia llave

Lienox es una de varias, y para bastante gente no es la que le conviene. Estas son las categorías reales y qué resuelve cada una.

Camino Coste del software Cuándo es el correcto
La API del proveedor a pelo, con tus propios scripts Cero Sabes programar y tu flujo es fijo. Nada supera esto en coste, y nada cuesta más de mantener.
Agentes de terminal (Claude Code, Codex, OpenCode) Suscripción o tu llave Trabajas en la terminal y una sesión a la vez te basta.
Editores con IA (Cursor y similares) Cuota, BYOK en algunos El trabajo es escribir código y ocurre dentro del editor.
Orquestadores de escritorio (Lienox y su categoría) Cuota plana Necesitas varios agentes a la vez, programados, y que el trabajo pase en tu propia máquina.
Modelo local con Ollama o llama.cpp Cero, más el hardware El requisito es que ningún token salga de tu red. Se paga en calidad de modelo.

Lienox cobra una cuota plana por el software —hay un plan gratuito, y los de pago están en la página de planes— y no toca la inferencia: funciona con tu llave de OpenRouter o NVIDIA, con la suscripción que ya pagas de Claude Code, Codex, OpenCode o Kimi, o con un modelo local vía Ollama. Lo que compras es la orquestación, no los tokens.

Preguntas frecuentes

BYOK, en concreto

¿Qué significa BYOK exactamente?

BYOK son las siglas de «bring your own key», trae tu propia llave. Significa que la herramienta que usas no te vende inferencia: tú contratas una API key directamente con el proveedor del modelo y la herramienta la usa para hacer las peticiones. El proveedor te factura a ti, a su tarifa pública, y la herramienta cobra aparte por su software.

¿BYOK es siempre más barato?

No. Es más barato cuando consumes mucho, porque desaparece el margen del intermediario. Con consumo ligero suele salir peor: los planes gratuitos y de entrada de las herramientas con créditos están dimensionados para ese uso y a menudo lo subvencionan. La regla práctica es que si tu uso cabe holgadamente en un plan de entrada, BYOK sólo te añade trabajo administrativo.

¿Cómo controlo el gasto si la llave es mía?

En el panel del proveedor, y hay que hacerlo antes de empezar, no después. Anthropic, OpenAI y Google permiten fijar un límite de gasto mensual y avisos por umbral. Es el paso que más gente se salta y el único que separa una factura inesperada de una noche tranquila, sobre todo si vas a dejar tareas programadas corriendo solas.

¿Puedo usar BYOK con la suscripción que ya pago?

Depende de la herramienta. Algunas sólo aceptan una API key; otras también entran con la sesión de una suscripción existente, lo que evita pagar dos veces por la misma inferencia. Lienox admite las dos vías: llave propia con OpenRouter o NVIDIA, y sesión de suscripción con Claude Code, Codex, OpenCode o Kimi sin pegar ninguna llave.

¿Dónde se guarda mi llave y quién la ve?

Esa es la pregunta correcta y la respuesta cambia por completo el riesgo. Si la herramienta es un servicio en la nube, tu llave vive en su servidor y hay que confiar en cómo la guarda. Si es una aplicación de escritorio, puede quedarse en tu disco y no salir nunca — que es como funciona en Lienox. Antes de pegar una llave en cualquier sitio, pregunta dónde se almacena y desde dónde se usa.

¿Cuánto consume de verdad un agente trabajando?

Mucho más que un chat, y por un motivo estructural: cada paso del agente reenvía el contexto acumulado, así que el consumo de entrada crece con la longitud de la tarea en vez de mantenerse plano. Una estimación hecha sobre unas cuantas preguntas se queda corta por un factor grande. La única cifra fiable es la tuya: corre tu tarea real un día con el contador del proveedor delante.

¿Y si no quiero pagar inferencia en absoluto?

Entonces lo que buscas es un modelo local, no BYOK. Con Ollama o llama.cpp sirviendo un modelo de pesos abiertos en tu propia máquina, no hay factura de tokens: el coste es el hardware y la electricidad. Se paga en calidad, porque los modelos que caben en un equipo de escritorio siguen por detrás de los mejores modelos por API, y en tareas largas esa diferencia se acumula.

Pruébalo con tu propia llave

El plan gratuito no recorta funciones ni pide tarjeta. Instálalo, pega tu llave o entra con la suscripción que ya pagas, y mira el contador del proveedor mientras trabaja.