Volver a Aprende/Infraestructura
Proceso de ejecutar un modelo para producir una salida a partir de una entrada.
La inferencia es el momento en que el modelo trabaja: recibe contexto y produce una salida. Puede ocurrir en la infraestructura de un proveedor mediante API, o localmente sobre infraestructura propia.
La inferencia local exige dimensionar hardware: tamaño del modelo, cuantización, ventana de contexto, memoria disponible, concurrencia esperada, velocidad necesaria y volumen de inferencia. Por eso decir simplemente que un equipo corre un modelo de ciertos parámetros no define si una implementación será adecuada.
La decisión entre API externa e inferencia local se toma por privacidad, costo, latencia y control —medido, no estimado.