Due Diligence de la economía unitaria de la IA: costes de inferencia y márgenes brutos

Due Diligence de la economía unitaria de la IA: costes de inferencia y márgenes brutos

Image: Plausity

Key Takeaways

  • El coste de inferencia de nivel GPT-3.5 cayó a 0,07 dólares por millón de tokens en octubre de 2024, una reducción de más de 280 veces en unos 18 meses, por lo que los modelos de márgenes deben indicar si asumen que esta tendencia continúa.
  • Los márgenes brutos son específicos de cada empresa: dentro de la misma categoría, algunas empresas de IA de rápido crecimiento operan muy por debajo de la norma del software, mientras que competidores de crecimiento más lento se sitúan mucho más cerca de ella.
  • El S-1 de CoreWeave muestra que la concentración corta en ambos sentidos: un solo cliente hyperscaler aportó la mayoría de los ingresos de 2024, y casi todo procedía de contratos take-or-pay comprometidos.
  • Comprueba si los ingresos escalan más rápido que el coste de servicio: los clientes con uso intensivo no son automáticamente los más rentables.

Qué significa el due diligence de la economía unitaria de la IA

El due diligence de la economía unitaria de la IA es la capa económica del análisis tecnológico due diligence tecnológico: la prueba estructurada de si los ingresos de una empresa objetivo escalan más rápido que los costes de entregar IA a medida que crece el uso. Se sitúa por debajo de la revisión de producto y tecnología y plantea una pregunta más acotada que «¿es buena la IA?». Pregunta cuánto cuesta realmente servir una unidad incremental de trabajo entregado —un documento procesado, una consulta respondida, un flujo de trabajo completado— y si ese coste baja o sube a medida que se expande la base de clientes. Las tres variables centrales son el coste de servicio, la sensibilidad del margen bruto y el poder de fijación de precios: cuánto cuesta ejecutar el flujo de trabajo de IA, cuán expuesto está el margen a cambios en ese coste y si la empresa puede mantener o subir precios mientras los costes se mueven.

Esta capa merece su propio flujo de trabajo porque el coste de bienes vendidos de la IA se comporta de forma distinta al del software tradicional. En el SaaS clásico, atender a un cliente adicional es casi gratuito, de modo que los márgenes brutos se agrupan en niveles altos y el due diligence puede tratarlos como estables. En los productos de IA, una gran parte del coste de entrega es variable y medido: cada flujo de trabajo consume tokens, y cada token se factura a un proveedor de modelos o se paga como capacidad de nube y GPU. Que los márgenes de una empresa objetivo se parezcan a los del software tradicional o sean notablemente más estrechos es una cuestión empírica sobre su propia arquitectura, contratos y mezcla de clientes, no una ley de la categoría.

La disciplina para los equipos de deal es evitar afirmaciones generalizadas en cualquier dirección. Un comentario que declare que el software de IA tiene márgenes estructuralmente más bajos es tan poco contrastado como el supuesto de que los productos de IA conllevan márgenes SaaS. Los benchmarks de venture capital publicados para 2025 muestran una amplia dispersión dentro de la misma categoría: algunas de las empresas de IA que escalan más rápido operan con márgenes brutos muy por debajo de la norma del software, a veces negativos a nivel unitario, mientras que competidores de crecimiento más lento se sitúan mucho más cerca de los niveles del software convencional. Ambos perfiles existen en la misma categoría, al mismo tiempo. La tarea en la due diligence es ubicar a la objetivo en ese espectro usando sus propias cifras y luego probar cuán duradera es su posición. Este es el complemento económico de la visión tecnológica expuesta en nuestro marco de due diligence del foso defensivo de software AI-nativo.

Definición: probar si los ingresos escalan más rápido que los costes de inferencia, API de terceros y hosting a medida que crece el uso de los clientes.

Variables clave: coste de servicio por flujo de trabajo y por cliente, sensibilidad del margen bruto a cambios de coste y uso, y poder de fijación de precios para mantener o trasladar cambios de coste.

Por qué ahora: los resultados de margen son específicos de cada empresa y producto, por lo que los promedios sectoriales y las narrativas de categoría son un mal sustituto de la propia pila de costes de la objetivo.

Disciplina de due diligence: sin afirmaciones de margen generalizadas; el marco siguiente trata la durabilidad del margen bruto como una hipótesis que debe evidenciarse, no asumirse.

La pila de costes de IA: de los tokens al coste de servicio

El primer paso analítico es mapear dónde se sitúa realmente el coste de los bienes de la IA. La partida visible es el gasto de inferencia por token con los proveedores de modelos, facturado por millón de tokens a tarifas de lista que varían según el nivel del modelo. Alrededor se sitúan las tarifas de modelos y API de terceros para embeddings, transcripción u otros servicios especializados, el hosting en la nube y GPU para modelos autoalojados, el almacenamiento vectorial y la infraestructura de recuperación, y la capa de orquestación que enruta las peticiones entre ellos. Envolviendo todo esto están los costes humanos que los productos de IA aún conllevan: tiempo de ingeniería en prompts y evaluación, soporte al cliente y, en muchos casos, trabajo de revisión o QA sobre la salida de la IA.

A partir de esta pila, se construye un coste variable por flujo de trabajo y por cliente, el punto donde este análisis se encuentra con la due diligence financiera. Tome un flujo de trabajo representativo, mida los tokens consumidos por ejecución, aplique el precio combinado por token, añada la parte de los costes de hosting, almacenamiento y orquestación que escala con el uso, e incluya el coste humano por unidad cuando la salida se revisa. Repetir esto en los segmentos de clientes produce una visión del coste de servicio que puede contrastarse con los ingresos por cliente para obtener el margen de contribución por segmento. El resultado rara vez coincide con lo que presenta la dirección: la mayoría de los materiales directivos muestran un margen bruto agregado, no una imagen de costes a nivel de cliente.

Un hallazgo constante es que el coste real de un flujo de trabajo de IA supera la factura bruta de API. La factura de tokens es la cifra más legible, por lo que ancla la mayoría de los análisis internos, pero subestima el coste de entrega de formas predecibles. Los costes de recuperación y almacenamiento escalan con el corpus documental, no con los ingresos. La orquestación a menudo llama varias veces a modelos más baratos por cada salida visible. Las ejecuciones fallidas, los reintentos y el tráfico de evaluación consumen tokens que nunca llegan a un cliente. Y la capa de revisión humana, cuando existe, es un coste real de bienes que ningún registro de tokens captura. Un modelo de coste de servicio apto para due diligence parte, por tanto, de la factura de API, pero debe reconciliarse al alza hasta el coste de entrega totalmente cargado.

Gasto de inferencia por token con los proveedores de modelos, a tarifas que difieren drásticamente según el nivel del modelo y el compromiso de volumen.

Tarifas de modelos y API de terceros para embeddings, transcripción, filtrado de seguridad y otros servicios especializados.

Hosting en la nube y GPU para modelos autoalojados o ajustados, incluida la capacidad reservada en lugar de consumida bajo demanda.

Almacenamiento vectorial, infraestructura de recuperación y orquestación, que escalan con el tamaño del corpus y la complejidad del flujo de trabajo en lugar de con los ingresos.

Costes humanos y de soporte: ingeniería de prompts, evaluación, revisión de salidas y éxito del cliente, que forman parte del coste de servicio aunque ningún registro de tokens los muestre.

Precios de inferencia a la baja y durabilidad del margen

La curva de deflación es la tendencia mejor evidenciada en la economía de la IA, y es genuinamente pronunciada. El análisis de a16z sobre precios históricos desde GPT-3 concluyó que, para un LLM de rendimiento equivalente, el coste de inferencia cae aproximadamente 10x al año, con el coste de una puntuación fija en MMLU reduciéndose en un factor de 1.000 en tres años.[1] El Stanford AI Index 2025 registra que el coste de consultar un modelo con rendimiento de nivel GPT-3.5 en MMLU cayó de $20.00 por millón de tokens en noviembre de 2022 a $0.07 en octubre de 2024, una reducción de más de 280 veces en aproximadamente 18 meses, y señala que, según la tarea, los precios de inferencia de LLM han caído entre 9 y 900 veces al año.[2] Ese rango, más que cualquier múltiplo titular aislado, es el insumo correcto para un modelo de márgenes, que debe tratar la deflación como una variable de escenario y no como una constante.

Para la due diligence, la curva corta en ambos sentidos, y la pregunta no es si los precios caen, sino quién captura la caída. Si los márgenes brutos de un objetivo mejoran principalmente porque su proveedor de modelos sigue recortando los precios de lista, la mejora es un traspaso de una tendencia sectorial, no una prueba de una economía propia de la empresa. En mercados competitivos, los proveedores tienden a competir esos ahorros hasta hacerlos desaparecer: los clientes esperan que los precios bajen a medida que bajan los costes del proveedor, y los rivales fijan precios agresivos para ganar cuota. Un puente de márgenes que dependa de una deflación continuada de los precios de los insumos debería someterse a pruebas de estrés frente a un escenario en el que la deflación se ralentice, o en el que la competencia obligue al objetivo a traspasar los ahorros a los clientes. Igualmente, un objetivo cuyos costes caen pero cuyos precios están fijados por contrato puede ser uno de los verdaderos ganadores de la tendencia; la cuestión es identificar, con evidencias, en qué lado del traspaso se sitúa el objetivo.

La dirección también dispone de palancas de eficiencia que sí puede accionar, y las preguntas de due diligence son cuáles de ellas utiliza el objetivo y cuánto vale cada una. a16z atribuye la caída de precios a varias fuerzas independientes: una mejor relación coste-rendimiento de las GPU, la cuantización de modelos, la optimización de software que reduce los requisitos de cómputo y memoria, modelos más pequeños entrenados con más datos, un mejor ajuste por instrucciones y la competencia del código abierto comprimiendo márgenes en toda la cadena de valor.[1] Un objetivo puede enrutar las peticiones rutinarias hacia modelos más pequeños y reservar los modelos frontera para los casos difíciles, cuantizar los modelos que aloja por sí mismo, almacenar en caché las consultas repetidas y reducir los tokens desperdiciados mediante una mejor recuperación. Cada palanca tiene un coste de ingeniería y un riesgo de calidad, así que la prueba consiste en determinar si el objetivo tiene una hoja de ruta medida para estas palancas o si trata la caída de precios como su único plan de márgenes.

La evidencia de la deflación: aproximadamente 10x al año a rendimiento constante, una caída de más de 280 veces para una calidad de nivel GPT-3.5 en unos 18 meses, y descensos de entre 9 y 900 veces al año según la tarea.[1][2]

Quién captura los ahorros: ¿el objetivo retiene la caída de los costes de los insumos como margen, o la competencia en precios los traspasa a los clientes? El puente de márgenes debe indicar cuál de las dos cosas ocurre, con evidencias.

Palancas de eficiencia: enrutamiento de modelos, cuantización, caché, optimización de prompts y recuperación, y modelos más pequeños para el trabajo rutinario. ¿Cuáles están desplegadas, cuáles están previstas y cuánto vale cada una en puntos básicos de margen bruto?

La prueba de estrés: recalcular el perfil de márgenes asumiendo que la deflación de los precios de los insumos se ralentiza de forma significativa, y ver cuánto del plan sobrevive.

Economía a nivel de cliente: intensidad de uso y margen de contribución

Los márgenes brutos agregados ocultan la distribución más importante de un negocio de IA: la relación entre la intensidad de uso y la rentabilidad. En una estructura de costes facturada por uso, los usuarios más intensivos consumen más tokens, de modo que los clientes que más valoran el producto pueden ser los más caros de atender. La prueba de due diligence consiste en clasificar a los clientes en deciles de uso y calcular el margen de contribución por cliente —ingresos menos el coste variable de entrega totalmente cargado— para cada decil. Si los deciles superiores son los más rentables, el crecimiento basado en el uso está componiendo el margen. Si los deciles superiores están en cero o por debajo en contribución, el crecimiento está destruyendo valor en el margen y el modelo de precios está desalineado con la estructura de costes.

Margen de contribución ilustrativo por decil de uso. La forma de esta curva, y no el margen bruto agregado, determina si el crecimiento del uso crea o destruye valor. · Generado con IA

La alineación del modelo de precios es la segunda mitad del análisis, y pertenece a la due diligence comercial tanto como al flujo de trabajo financiero. Los contratos basados en puestos desacoplan los ingresos del consumo: un cliente que duplica su uso con un precio fijo por puesto convierte la caída de los costes unitarios en una ganancia de margen, pero un cliente que cuadruplica su uso puede llevar la contribución a terreno negativo. Los contratos basados en el uso o híbridos reacoplan los ingresos al consumo y trasladan los choques de costes, pero exponen a la compañía objetivo a la competencia de precios sobre un insumo medido. Ningún modelo es inherentemente superior; la cuestión es si la estructura del contrato coincide con la estructura de costes, y si los precios se fijaron teniendo en cuenta el análisis de coste de servicio anterior.

Los datos de mercado muestran cuán amplia es la dispersión entre empresas. Los benchmarks de 2025 de Bessemer sitúan a las AI Supernovas de rápido crecimiento en torno a márgenes brutos del 25 %, a menudo negativos a nivel unitario, frente a aproximadamente el 60 % de las Shooting Stars, que crecen algo más despacio.[3] En la capa de infraestructura, TechCrunch informa de que Anthropic espera un margen bruto del 50 % este año y del 77 % para 2028, frente al -94 % del año anterior.[4] Un laboratorio de frontera y una empresa de aplicaciones son negocios distintos, pero lo relevante para la due diligence es la propia dispersión: empresas de la misma categoría abarcan todo el rango, y la posición de la compañía objetivo está determinada por su propia mezcla de uso, estructura de contratos y disciplina de costes.

Los mecanismos de traslado completan el panorama. Cuando los costes de los insumos de IA suben, ya sea por cambios de precios en un proveedor de modelos, restricciones de capacidad o un consumo mayor, ¿puede la compañía objetivo reajustar sus precios? Los contratos con precios fijos y sin límites de uso absorben el choque por completo. Los contratos con precios basados en el uso lo trasladan automáticamente. Los compromisos anuales con ventanas de renegociación se sitúan en un punto intermedio. Las preguntas de due diligence son concretas: qué proporción de los ingresos se renueva en los próximos doce meses, qué dicen realmente las cláusulas de precios y si la dirección ha probado la tolerancia de los clientes a subidas de precios que reflejen mayores costes de entrega.

Qué deben probar los inversores: lista de verificación de evidencias y señales de alerta

El marco se reduce a cinco pruebas esenciales, cada una de las cuales debería poder responderse a partir de documentos y no del relato de la dirección. En conjunto, establecen si los ingresos crecen más rápido que el coste de servicio, qué supuestos sustentan el perfil de margen futuro de la dirección y si la empresa puede trasladar los mayores costes de IA a los clientes.

Ingresos frente a coste de servicio: ¿los ingresos por cliente crecen más rápido que el coste variable totalmente cargado por cliente, en cada decil de uso, durante los últimos ocho trimestres?

Contribución a nivel de cliente: ¿los clientes con mayor uso son realmente los más rentables, o el crecimiento se concentra en clientes con contribución reducida o negativa?

Supuestos del puente de márgenes: ¿qué impulsa exactamente la mejora de margen proyectada por la dirección: deflación de precios de insumos, palancas de eficiencia, acciones de precios o mezcla, y está cada factor respaldado por evidencias?

Capacidad de traslado: ¿puede la empresa trasladar los mayores costes de IA a los clientes mediante condiciones contractuales, precios por uso o reajustes en la renovación, y qué proporción de los ingresos está protegida?

Dependencia de proveedores y precios: ¿cuál es la exposición de la base de costes a las decisiones de precios, capacidad y producto de un único proveedor de modelos, y qué alternativas existen y a qué coste de cambio?

La lista de solicitudes de evidencias debería incluirse en la sala de datos desde el principio, porque estos documentos requieren tiempo para elaborarse y son los que más a menudo faltan. Facturas de nube y de API de todos los proveedores, registros de uso de tokens por cliente y por flujo de trabajo, una cuenta de resultados a nivel de cliente o, como mínimo, una atribución de ingresos y costes por cuenta, contratos con proveedores de modelos que incluyan condiciones de gasto comprometido y tarifas, y los documentos de política de precios que rigen los reajustes y el traslado de costes. Cuando un documento no existe, ese hecho es en sí mismo un hallazgo: una compañía objetivo que no puede atribuir el coste por cliente no puede defender su historia de márgenes.

Concentración de proveedores, contratos y riesgo de compresión de márgenes

El riesgo de concentración en la cadena de valor de la IA se entiende mejor mediante un ejemplo práctico extraído de un documento público presentado ante el regulador. El S-1 de CoreWeave, presentado antes de su salida a bolsa en 2025, reveló que Microsoft fue su mayor cliente tanto en 2023 como en 2024, representando el 35 por ciento y luego el 62 por ciento de los ingresos.[5] Sus dos mayores clientes juntos representaron el 77 por ciento de los ingresos de 2024, y los contratos comprometidos de tipo take-or-pay, generalmente de dos a cinco años de duración, representaron el 96 por ciento de los ingresos de ese año.[5] El propio documento advirtió de que cualquier cambio negativo en la demanda de Microsoft afectaría negativamente al negocio. La lección para el due diligence a nivel de objetivo es estructural: en cada capa de la cadena de valor de la IA, un pequeño número de contrapartes controla insumos críticos, y las condiciones que imponen —precios, capacidad, duración de los contratos— fluyen directamente al coste de los bienes de una empresa dependiente.

Trasladado a un objetivo de adquisición, las preguntas sobre el upstream son directas. ¿Depende el objetivo de un único proveedor de modelos o de una única nube para la mayoría de su gasto en inferencia, y qué proporción de ese gasto corresponde a tarifas comprometidas frente a precios de lista bajo demanda? Los contratos de gasto comprometido compran estabilidad de precios y prioridad de capacidad, pero crean costes mínimos que persisten si el uso decepciona; los precios bajo demanda se flexibilizan con el uso, pero exponen al objetivo a movimientos de precios de lista que no puede controlar. El análisis de concentración también debe ejecutarse en el downstream: un objetivo cuyos propios ingresos dependen en gran medida de uno o dos clientes hereda la misma fragilidad que CoreWeave reveló, con la exposición añadida de que sus mayores clientes pueden estar negociando condiciones equivalentes con sus competidores.

A continuación, los escenarios de compresión de márgenes deben modelizarse de forma explícita. El caso más ilustrativo reciente es el de Anthropic, que según la información publicada por TechCrunch espera un margen bruto del 50% este año, frente a una cifra del -94% del año anterior, con un objetivo del 77% para 2028.[4] Incluso un laboratorio frontera con ventajas de escala y sus propios programas de eficiencia trata el margen como una trayectoria que hay que gestionar, no como una cifra estable. Para un objetivo, los escenarios que hay que someter a estrés son: precios de insumos que dejan de caer o suben, patrones de uso que se desplazan hacia un consumo más intensivo, un cliente importante que renegocia en la renovación, y un proveedor de modelos que cambia su estructura de precios o descontinúa un modelo del que depende el producto del objetivo.

Para el private equity y las fusiones y adquisiciones, estos hallazgos se traducen en la estructura de la operación. Cuando la durabilidad del margen no puede demostrarse por completo, la valoración debe reflejarlo, ya sea mediante un descuento o mediante un precio que asuma el escenario de estrés en lugar del escenario de la dirección. Las estructuras de earnout pueden vincular la contraprestación al margen bruto realizado, alineando a los vendedores con el perfil de margen que han representado. La cobertura de representaciones y garantías debe abordar explícitamente los supuestos de coste: la exactitud de la atribución de costes, las condiciones de los contratos con proveedores de modelos y cualquier obligación de gasto comprometido que se convierta en responsabilidad del comprador en el cierre. Nada de esto es adversarial; es la respuesta estándar ante una estructura de costes más dependiente de contratos que la del software tradicional.

Cómo aplicar esto en tu próximo flujo de trabajo de due diligence

El marco se convierte en un flujo de trabajo secuenciado que va desde el acceso al data room hasta el comité de inversión. Cada paso se corresponde con las pruebas y los puntos de referencia descritos anteriormente, y cada uno produce un artefacto específico que el equipo de operación puede defender.

Ingestar el data room: conectarse al VDR y procesar las facturas, contratos, modelos financieros y materiales de la dirección que contienen la evidencia de costes, incluidas las facturas de nube y de API, los acuerdos con proveedores de modelos y los documentos de política de precios de la lista de verificación anterior.

Extraer la evidencia de costes: obtener los registros de uso de tokens y las partidas de facturación de todos los proveedores, y conciliar la factura bruta de API al alza hasta un coste variable totalmente cargado por flujo de trabajo, cubriendo alojamiento, almacenamiento, orquestación y revisión humana.

Construir la vista de coste de servicio: elaborar el margen de contribución por cliente y por decil de uso, y contrastarlo con los ingresos por cliente para establecer si los usuarios más intensivos son los más rentables.

Someter a estrés el puente de márgenes: descomponer el perfil de margen proyectado por la dirección en deflación de precios de insumos, palancas de eficiencia y acciones de precios, y resuscribirlo bajo un escenario de deflación más lenta, comparándolo con los datos de márgenes del BVP State of AI 2025.[3]

Empaquetar los hallazgos: reunir los hallazgos sobre márgenes y concentración, las señales de alerta y el análisis de traspaso de costes en un memorando respaldado por evidencia para el comité de inversión.

Plausity apoya cada paso de este flujo de trabajo. Data Room Ingestion se conecta al VDR y procesa facturas, contratos y modelos financieros en cuestión de minutos, de modo que la evidencia de costes entra de inmediato en el análisis en lugar de esperar a una indexación manual. El AI-Analysis Engine lee y cruza esos documentos, conectando las partidas de facturación y los registros de uso con el modelo de la dirección y detectando dónde las cifras no cuadran. Risk Radar evalúa los hallazgos por materialidad, impacto financiero y relevancia para la operación, de modo que los riesgos de compresión de márgenes y de concentración de proveedores se clasifican junto con el resto del registro de riesgos. Report Builder redacta el memorando respaldado por evidencia con trazabilidad completa de las fuentes hasta los documentos subyacentes, y Collaboration Hub mantiene alineados los flujos de trabajo a medida que convergen la vista de coste de servicio, el puente de márgenes y los materiales para el comité de inversión. El resultado es un análisis de márgenes en el que cada cifra se remite a un documento del data room, que es el estándar que exigen las cinco pruebas anteriores.

Cómo Plausity acelera este flujo de trabajo

Plausity es una plataforma de Due Diligence y deal intelligence AI-native que ayuda a firmas asesoras M&A, fondos VC y PE, equipos de corporate development y equipos de investment banking a estructurar evidencia, findings y preguntas a través de una Data Room. Plausity apoya la extracción de evidencia, el source grounding, la gestión de findings y la preparación del Investment Committee — no sustituye a analistas, asesores ni profesionales de inversión, no proporciona asesoramiento legal, fiscal, de auditoría, regulatorio ni de inversión, y no toma decisiones de inversión autónomas. Todos los findings requieren revisión humana.

Para explorar las capacidades subyacentes, consulta el motor de análisis IA de Plausity y la página de Findings & Risk Intelligence. Para workflows por equipo, mira cómo los fondos VC y PE y las firmas asesoras M&A usan Plausity en deals activos.

Fuentes

  1. [1] a16z.com — https://a16z.com/llmflation-llm-inference-cost/
  2. [2] hai.stanford.edu — https://hai.stanford.edu/ai-index/2025-ai-index-report/research-and-development
  3. [3] bvp.com — https://www.bvp.com/atlas/the-state-of-ai-2025
  4. [4] techcrunch.com — https://techcrunch.com/2025/11/04/anthropic-expects-b2b-demand-to-boost-revenue-to-70b-in-2028-report/
  5. [5] crn.com — https://www.crn.com/news/ai/2025/7-things-to-know-about-coreweave-s-s-1-top-customers-revenue-and-more

Frequently Asked Questions

PLAUSITY

AI Summary

Ask an AI assistant to summarise Plausity.