RSS Amplifier

The Asymmetric Advantage · Apr 2, 2026

La fábrica invisible

0
Sign in to vote or save

Camilo Gomez · The Asymmetric Advantage

Entrenar un modelo de inteligencia artificial cuesta cientos de millones de dólares. Esa cifra se repite tanto que ya perdió el efecto. Pero entrenar un modelo es como construir una fábrica. El valor real está en lo que produce cada día.

Inferencia es ese proceso: el modelo corriendo en producción, respondiendo consultas, generando texto, procesando imágenes. Cada pregunta que usted le hace a Claude, cada ticket que un agente de IA resuelve, cada línea de código que un IDE le sugiere — detrás de todo eso hay un sistema de inferencia.

La ingeniería que hace que ese sistema corra rápido, barato y confiable a escala es hoy la disciplina más valiosa de toda la industria de IA. Y casi nadie en América Latina está hablando de ella.

Cuando ChatGPT se lanzó a finales de 2022, había unos cientos de ingenieros de inferencia en el mundo. Trabajaban en OpenAI, en Google, en NVIDIA. Nadie más corría modelos en producción.

Hoy hay más de dos millones de modelos abiertos en Hugging Face (el equivalente a GitHub para IA). Cuando DeepSeek V3 y R1 salieron en diciembre de 2024, la brecha de calidad entre modelos cerrados (GPT, Claude) y modelos abiertos (Llama, DeepSeek, Qwen) se cerró. Un modelo abierto iguala al mejor modelo cerrado en semanas. A veces lo supera.

Cualquier empresa con el equipo adecuado puede correr su propia inteligencia.

Puede ajustar un modelo abierto a su dominio específico y superar la calidad de las APIs comerciales en su caso de uso. Puede controlar la latencia, la disponibilidad y el costo.

Pero “puede” y “lo hace bien” son cosas distintas. Ahí entra la ingeniería de inferencia.

Poner un modelo a correr en un GPU no alcanza. La inferencia a escala de producción requiere tres capas trabajando juntas.

Runtime. Cómo corre un modelo individual en un GPU (o varios GPUs en una misma instancia). Aquí operan los motores de inferencia como vLLM, SGLang y TensorRT-LLM, junto con optimizaciones de bajo nivel como FlashAttention.

Infraestructura. Un solo servidor se satura. La capa de infraestructura escala la capacidad a través de clusters, regiones y proveedores de nube: autoescalado, distribución geográfica, redundancia contra caídas.

Herramientas. Los ingenieros que operan estos sistemas necesitan el nivel correcto de abstracción: suficiente control para optimizar casos específicos, suficiente automatización para mantener la productividad.

Cuatro métricas definen la calidad de un sistema de inferencia:

TTFT (time to first token). Cuánto tarda el modelo en empezar a responder. Un usuario que espera tres segundos para ver la primera palabra percibe un producto lento.

TPS (tokens por segundo). La velocidad a la que el modelo genera texto. La “velocidad de escritura.”

ITL (intertoken latency). El tiempo entre un token y el siguiente. En aplicaciones de voz o tiempo real, milisegundos definen la experiencia.

Costo por request. Cuánto paga usted cada vez que un usuario interactúa con su modelo. A escala, esta métrica define si el producto es viable o no.

Cuantización. Reducir la precisión numérica de los pesos del modelo. Un modelo entrenado en 16 bits puede correr en 8 o en 4 bits, usando menos memoria y procesando más rápido. El riesgo: una cuantización mal hecha degrada la calidad de las respuestas. En la práctica, bajar un nivel de precisión da entre 30% y 50% más rendimiento sin pérdida perceptible.

Decodificación especulativa. Generar varios tokens “borrador” de golpe y validarlos en una sola pasada, en vez de generar uno por uno. Validar una respuesta de sudoku es rápido; resolverlo desde cero es lento. El mismo principio aplica. Funciona mejor cuando el sistema tiene capacidad de cómputo ociosa (la mayor parte del tiempo en la fase de decodificación).

Caching. Reutilizar los resultados de cómputos anteriores (el KV cache) entre solicitudes que comparten contexto. Un chatbot empresarial que usa el mismo system prompt de 2.000 tokens en cada conversación puede saltarse ese procesamiento después de la primera vez. Las APIs comerciales cobran menos por tokens de “cache hit” por esta razón.

Paralelismo. Distribuir el modelo entre varios GPUs para que cada uno procese una fracción del trabajo. Tensor Parallelism divide cada capa del modelo entre GPUs. Expert Parallelism (para modelos MoE, la arquitectura dominante en modelos abiertos) asigna expertos completos a GPUs individuales.

Desagregación. Separar las dos fases de inferencia (prefill y decode) en servidores distintos. Prefill consume cómputo. Decode consume memoria. Bajo tráfico alto, compiten por los mismos recursos. Separarlos permite optimizar cada fase por separado.

Las APIs comerciales (Anthropic, OpenAI, Google) resuelven el problema de inferencia para usted. Usted paga por token y se olvida. Para un MVP o un producto en etapa temprana, tiene sentido.

A medida que una empresa escala su uso de IA, la ecuación cambia. El costo se vuelve el renglón más grande de la operación. Modelos abiertos pueden ser 80% más baratos a escala.

Pero 80% es el piso.

Según una presentación reciente de Shopify, la empresa pasó de un pipeline basado en GPT-5 vía API que costaba $5.5 millones al año y cubría 20.000 tiendas, a una arquitectura agéntica con subagentes especializados corriendo Qwen self-hosted por $73.000 al año. 150.000 tiendas. El doble de precisión (F1).

De $5.5M a $73K. 7.5x más cobertura. El doble de precisión. Ingeniería de inferencia.

[Fuente:

X avatar for @dbreunig

Drew Breunig@dbreunig

The entire case study is a perfect example of how DSPy helps you run maintainable, efficient, and reliable LLM programs. Watch the whole thing here:

youtube.com

From One-Shot to Agentic: Optimizing Shop Intelligence with DSPy @ Shopify Scale

4:14 PM · Mar 30, 2026 · 29.8K Views

28 Reposts · 291 Likes

]

Ese resultado no salió de cambiar un modelo por otro. Shopify rediseñó toda la arquitectura: pasó de un prompt monolítico sin optimización a un sistema de agentes especializados, cada uno optimizado con DSPy y GEPA. El ahorro vino de la ingeniería.

Las startups de IA que están creciendo más rápido (Cursor, Clay, Gamma, Mercor) ya migraron a modelos propios o abiertos. Los equipos que entienden inferencia son los que pueden tomar esa decisión y ejecutarla.

Para una empresa en Latinoamérica la estrategia de inferencia va a ser necesaria. La pregunta es si va a tener el equipo para implementarla cuando llegue el momento.

Cuando ChatGPT se lanzó, había unos cientos de ingenieros de inferencia en el mundo. La disciplina ni siquiera tenía nombre. Hoy, cada empresa que construye productos de IA serios necesita uno. La brecha entre la demanda y la oferta de este talento es de las más agudas en la industria. El primer país de América Latina que produzca ingenieros de inferencia a escala va a tener una ventaja desproporcionada en la economía de IA que se viene.

No posts

Read the original on theasymmetricadvantage.substack.com

Comments

Nothing yet. Say the first thing.

    Sign in to join the conversation.