EstrategiaWorking Paper

Inferencia de IA a escala: Acelerando el PIB

Canadá no necesita ganar la carrera global por construir los mayores clústeres de entrenamiento para triunfar en la carrera del crecimiento. La ruta más rápida para obtener ganancias medibles en el PIB es amplificar nuestra fuerza laboral existente con herramientas de IA centradas en la inferencia — un problema de despliegue, no una contienda de investigación. Con inversión dirigida, salvaguardias soberanas y una contratación pública que recompense los resultados, Canadá puede convertir la IA en productividad a escala en un plazo de 12 a 24 meses.

Richard St-Pierre·3 de septiembre de 2025·8 min read
ai-inferenceproductivitygdp-growthcanadasovereign-aiai-policyprocurementclean-compute

Hallazgo clave: La ventaja comparativa de Canadá es el despliegue gobernado a escala — convirtiendo modelos de clase mundial, dondequiera que se hayan entrenado, en herramientas soberanas y confiables en manos de los canadienses. Si solo el 5% de los trabajadores logran una ganancia neta de productividad del 40% en su combinación de tareas, se produce un aumento de ~2% en el PIB real como caso base — y estas ganancias llegan ahora, no después de gastos de capacitación especulativos y plurianuales.

Canadá no necesita ganar la carrera global para construir los mayores clústeres de capacitación para ganar la carrera de crecimiento. La ruta más rápida para obtener ganancias medibles del PIB es amplificar nuestra fuerza laboral existente con herramientas de IA centradas en la inferencia — sistemas que "piensan antes de responder", automatizan el trabajo de conocimiento rutinario y aumentan la calidad y velocidad de las decisiones diarias. Este es un problema de despliegue, no un concurso de investigación. Con inversión dirigida, barreras de seguridad soberanas y una contratación pública que recompense los resultados, Canadá puede convertir la IA en productividad a escala en un plazo de 12 a 24 meses.

La lógica macro: De la productividad individual a la producción nacional

El PIB crece a corto plazo cuando se produce más con las mismas horas de trabajo, y a largo plazo cuando el capital y la productividad total de los factores aumentan. Las herramientas de inferencia — copilotos para escritura, análisis, codificación, verificaciones de cumplimiento y flujos de trabajo de reuniones a entregables — comprimen los tiempos de las tareas, mejoran la calidad de la primera pasada y permiten el trabajo en paralelo.

Dos advertencias merecen ser mencionadas. Primero, la realización importa: las organizaciones deben rediseñar los flujos de trabajo y capturar el ahorro de tiempo como colas más cortas, SLA más rápidos, más casos cerrados o contrataciones evitadas. Segundo, los beneficios se acumulan: la inversión en herramientas de inferencia también aumenta el stock de "capital intangible" (manuales, prompts, plantillas verificadas, ontologías de dominio), impulsando al alza la producción potencial a largo plazo.

Por qué Canadá debería priorizar la inferencia sobre el entrenamiento de modelos de vanguardia

Canadá es un tomador de escala, no un fijador de precios, en el entrenamiento de modelos de miles de millones de dólares. Entrenar modelos de frontera requiere centros de datos multigigavatios, suministro de memoria exótica y largas cadenas de suministro globales — apuestas de alto riesgo y baja certeza para una economía de tamaño medio. Por el contrario, el despliegue centrado en la inferencia es ligero en capital, rápido de implementar y impacta la amplia base del PIB intensivo en servicios (administración pública, salud, educación, finanzas, servicios profesionales). La tecnología es lo suficientemente madura para entregar ahora, y el rendimiento por vatio mejora en cada ciclo de producto. En pocas palabras: deberíamos comprar la curva de costos decreciente, no financiarla.

Canadá está mejor posicionado para la infraestructura del ciclo de vida de un producto desplegado. Una buena regla general sobre el uso de GPU en la evolución del modelo de IA:

  • Pre-entrenamiento: el gran pico. ~90–98% del cómputo para construir un modelo; cae a 30–60% del cómputo total del ciclo de vida una vez que se atienden muchos usuarios.
  • Post-entrenamiento (SFT/RLHF): pequeño. ~0.5–5% del cómputo total.
  • Razonamiento en tiempo de inferencia: minúsculo en el momento de la construcción, pero dominante en producción si el uso es alto o si se habilita el razonamiento de estilo largo/cadena de pensamiento. Típicamente 40–70% del cómputo del ciclo de vida a escala.

Use "1 unidad" = una pasada hacia adelante para generar un token.

  • Pre-entrenamiento:3 unidades por token de entrenamiento (hacia adelante + hacia atrás), en billones de tokens → cómputo único enorme.
  • Post-entrenamiento: similar 3× por token pero en ~1–5% de la cantidad de tokens → pequeño.
  • Razonamiento en tiempo de inferencia:r unidades por token de salida, donde r = 1–3 para chat normal, r = 5–20 para razonamiento profundo/en tiempo de prueba (autoconsistencia, bucles de herramientas, CoT largo). Si se sirven muchos tokens, esto domina.

Proporciones útiles bajo tres escenarios comunes:

EscenarioPre-entrenamientoPost-entrenamientoInferencia
Solo construcción (sin usuarios aún)~96%~3%~1%
Uso moderado (~4T tokens de salida/año, r=3)~66%~2%~32%
Producto de razonamiento a escala (~10T tokens de salida/año, r=5)~32%~1%~67%

La pila que Canadá debe desplegar — Construida para la productividad, gobernada para la soberanía

Una pila nacional de productividad de IA debe ser estandarizada, soberana y orientada a los flujos de trabajo que impulsan la producción pública y privada:

  • Copilotos y agentes en el punto de trabajo: copilotos de escritura/análisis en suites de oficina; copilotos de código; agentes de reunión → actas → tareas; automatizaciones de formularios a informes; asistentes aumentados por recuperación para políticas, casos y precedentes.
  • Capa de recuperación (RAG): conectores seguros a repositorios departamentales/empresariales (SharePoint, almacenes de archivos, sistemas de casos), con almacenamiento en caché, evaluación y prompts de equipo rojo para prevenir alucinaciones.
  • Orquestación y monitoreo: política como código, control de prompts/versiones, registros de auditoría, limitación de velocidad y medidores de costos por usuario/equipo para que los gerentes puedan ver el tiempo ahorrado y los defectos evitados.
  • Plano de control soberano: residencia canadiense para datos y registros; claves gestionadas por el cliente; computación confidencial donde esté disponible; fragmentación/segmentación de datos por encima del almacenamiento; acceso robusto basado en identidad/atributos para registros sensibles.
  • Barreras de seguridad y confianza: detección de PII, DLP, filtros de contenido y barreras de seguridad específicas del sector (salud, justicia, finanzas), con revisión humana en el bucle para resultados de alto riesgo.
  • Elección de modelos: utilizar los puntos finales de inferencia (comerciales y abiertos) mejor disponibles a través de una capa intermediaria para que las cargas de trabajo puedan cambiarse por costo, latencia o riesgo — sin dependencia del proveedor.
  • Energía y borde: favorecer la inferencia eficiente (tokens por vatio) y habilitar huellas en las instalaciones/en el borde para entornos de datos sensibles a la latencia o restringidos (hospitales, tribunales, servicios de campo).

Política para convertir el potencial en PIB medido

  • Contratación pública que pague por resultados: preaprobar un catálogo de servicios y plantillas de IA; contratar por reducción del tiempo de ciclo, rendimiento de casos y tasas de error, no solo licencias. Permitir que los proveedores compitan por el costo por hora ahorrada y la mejora de la calidad.
  • Barreras de seguridad de soberanía por defecto: exigir la residencia canadiense para registros y embeddings; requerir KMS bajo control canadiense; incluir garantías de acceso legal y SLA de informes de incidentes; estandarizar los niveles de riesgo del modelo y los requisitos de revisión.
  • Habilitación a escala: financiar manuales basados en roles (por ejemplo, "paquete para adjudicador de reclamaciones", "paquete de RFP", "paquete de preparación de casos") y cohortes de formación de formadores; exigir a cada departamento/empresa que instrumente tres flujos de trabajo de alto volumen y publique métricas trimestrales.
  • Difusión en PYMES: proporcionar subvenciones de contrapartida o créditos fiscales para la adopción en el primer año por parte de PYMES en servicios, construcción, logística y atención — sectores donde las ganancias en tiempo de ciclo se monetizan rápidamente.
  • Talento y seguridad: microcredenciales para ingeniería de prompts, evaluación y operaciones de IA (AIOps); crear un registro público de prompts/plantillas evaluados con notas de equipo rojo para su reutilización en el gobierno y la industria.

Un programa nacional de 12 meses (secuenciado para el impacto)

Trimestre 1: Establecer el plano de control soberano y el marco de adquisición; incorporar un conjunto central de copilotos; seleccionar 10 flujos de trabajo nacionales que abarquen derivaciones de salud, procesamiento de beneficios, inspecciones, preparación de casos, adjudicación de subvenciones y redacción de RFP. Establecer líneas de base para los tiempos de ciclo y las tasas de error actuales.

Trimestre 2: Implementar la recuperación en los repositorios departamentales; enviar agentes basados en plantillas para los 10 flujos de trabajo; iniciar la presentación de informes mensuales de horas ahorradas, defectos evitados y casos cerrados.

Trimestre 3: Expandir a 50 flujos de trabajo en provincias/municipios e industrias prioritarias; publicar un panel de control público de los ahorros realizados (horas, dólares, niveles de servicio).

Trimestre 4: Optimizar: intercambiar modelos para mejorar el costo/latencia, reforzar las salvaguardias y formalizar la evaluación continua. Comenzar a codificar el capital intangible (prompts, ontologías, pruebas de equipo rojo) como un activo nacional compartido.

Qué aspecto tiene el éxito

En un año, reducciones medibles en los tiempos de ciclo (20–60%) en los flujos de trabajo prioritarios; mayor calidad en la primera pasada (menos revisiones/apelaciones); y capacidad de primera línea equivalente a miles de FTEs devueltos a trabajos de mayor valor, sin aumentar la plantilla. Si solo el 5% de los trabajadores logra una ganancia neta de productividad del 40% en su combinación de tareas, se produce un aumento del ~2% en el PIB real en el caso base. Una mayor adopción extiende el efecto. Fundamentalmente, estas ganancias llegan ahora, no después de gastos de capacitación especulativos y plurianuales.

Conclusión

La ventaja comparativa de Canadá es la implementación gobernada a escala, convirtiendo modelos de clase mundial, dondequiera que se hayan entrenado, en herramientas soberanas, confiables y ubicuas en manos de los canadienses. Al enfocarse en la productividad priorizando la inferencia, estandarizando una pila soberana y pagando por los resultados, podemos convertir la IA de una exageración en un crecimiento del PIB tangible en C$, de forma rápida, responsable y a escala nacional.

← Volver a los ensayos

Manténgase informado

Nuevos ensayos sobre soberanía digital, gobernanza de la IA y estrategia nacional — entregados al publicarse.