Publicado en Microsoft para Startups.
Muchas startups comienzan a construir productos de IA con un único modelo cerrado como una manera rápida de prototipar. Pero la selección de modelos para cargas de trabajo de aplicaciones es una decisión que se acumula a lo largo del ciclo de vida de un producto y determina los costes futuros y la diferenciación del producto.
Los modelos abiertos les permiten tomar esa decisión de manera más deliberada: ustedes eligen el modelo, lo ajustan a su caso de uso y moldean el comportamiento que distingue a su producto. Con Fireworks AI en Microsoft Foundry ya disponible a nivel general, pueden ofrecer inferencia de modelos abiertos de alto rendimiento y baja latencia directo en Azure. No necesitan construir su propia infraestructura de inferencia para ejecutar modelos abiertos aquí; Fireworks les sirve en Foundry, así que pueden empezar rápido y escalar esa huella a medida que avanzan.
Para ayudar, introducimos nuevos recursos para startups nativas de IA sobre cómo desplegar y servir modelos de Fireworks en Foundry y escalar desde prototipo hasta producción.
Plan de implementación diseñado para startups nativas de IA

El plan de implementación para desplegar modelos de IA de Fireworks muestra cómo los ingenieros fundadores y los pequeños equipos pueden pasar de la idea al MVP y al ajuste producto-mercado (PMF, por sus siglas en inglés) a través de la utilización de un enfoque repetible y nativo de Azure. La experiencia comienza de manera sencilla y crece según sus necesidades, así que ustedes son responsables de su inteligencia desde el principio.
La pila se ejecuta por completo dentro de su entorno Azure y solo requiere un endpoint modelo para la infraestructura o el harness de su aplicación. Empiecen con el despliegue de un único modelo, enrutar el tráfico a través de la Gestión de API, y seguir las métricas de latencia, uso y costes a lo largo del proceso. Cuando estén listos, pueden escalar con Azure Cache para Redis para reducir la inferencia redundante, a través de la introducción de ajustes de rendimiento según la carga de trabajo y desplegar múltiples variantes de modelos para pruebas A/B.
Los modelos de Fireworks se despliegan a través de Foundry dentro de su suscripción a Azure, por lo que el descubrimiento, la gobernanza y la facturación del modelo permanecen en un único plano de control.
| Componente | Propósito |
| Microsoft Foundry + Modelos de IA Fireworks | Foundry proporciona la plataforma nativa de Azure para el despliegue, la gobernanza y la facturación; Fireworks son la capa de inferencia que sirve a los modelos abiertos que hay detrás de ellos |
| Azure Container Apps | Aloja la aplicación o API que envía solicitudes de inferencia |
| Azure Container Registry | Almacena imágenes de contenedores |
| Azure Key Vault | Almacena credenciales e información de endpoints de manera segura |
| Azure Monitor (opcional) | Proporciona observabilidad y conocimiento del rendimiento |
Por qué las startups necesitan una arquitectura flexible de inferencia de IA
La inferencia es uno de los mayores factores de coste controlables para las empresas nativas de IA. Las decisiones tempranas sobre cómo se sirven los modelos pueden crear restricciones a largo plazo en costes, latencia y flexibilidad. Esta arquitectura está diseñada para abordar estos desafíos desde el principio. Servir modelos abiertos de esta manera mantiene esas decisiones en sus manos, para que puedan elegir, optimizar y cambiar los modelos detrás de su producto a medida que cambien sus necesidades de coste y rendimiento.
Optimizar el coste desde el primer día
- Utilicen inferencia serverless y de pago por token a través de Foundry con una selección de modelos abiertos
- Ajusten las cargas de trabajo al modelo más rentable y eviten estar atado a un solo proveedor de modelos
- Almacenar en caché las solicitudes repetidas con Azure Cache para Redis para reducir el uso de cómputo
- Rastrear el coste por millón de tokens como métrica central de ingeniería
Eliminar la sobrecarga de infraestructura
- No hace falta levantarse ni gestionar clústeres de GPU
- Fireworks proporciona inferencia de alto rendimiento, mientras que Foundry proporciona gobernanza, seguridad y gestión del ciclo de vida
Mantener la flexibilidad mientras escalas
- Experimentar y cambiar de modelo mediante APIs y flujos de despliegue consistentes, para que el intercambio requiera menos reestructuración
- Soportar pesos personalizados o para traer su propio modelo cuando sea necesario
- Pasar de la experimentación a la producción en la misma plataforma
- Una vez que la carga de trabajo está bien comprendida, sus suites de evaluación, bibliotecas de prompts y tráfico de producción graduado son datos de entrenamiento: los equipos pueden afinar y optimizar un modelo mediante Fireworks Training y luego importar a Azure al traer sus propios pesos.
Construir y probar aplicaciones de IA con menos presión inicial de costes
Para los equipos del programa Microsoft for Startups, esta arquitectura desbloquea una ventaja significativa. Pueden aplicar sus créditos de inicio a despliegues de modelos Fireworks a través de Data Zone Standard (las unidades de rendimiento provisionadas, o PTU, tienen capacidad reservada y no están cubiertas por créditos de startup), así como la infraestructura de Azure de apoyo.
Esto significa que pueden construir y probar aplicaciones de IA de calidad productiva, experimentar con múltiples modelos para encontrar dónde los modelos abiertos les dan la ventaja adecuada de coste y rendimiento antes de escalar, e iterar con rapidez hacia el ajuste producto-mercado, sin introducir presión inmediata sobre los costes de infraestructura.
Construyan con Microsoft para startups
Si están en el proceso de desarrollo de aplicaciones de IA en Azure, nos encantaría conocer más sobre su visión y ayudarles a acelerar su camino.
Microsoft for Startups ayuda a los fundadores a construir rápido, de manera inteligente y a vender más gracias a créditos de startup, infraestructura de IA Azure, orientación técnica y recursos de comercialización diseñados para ayudar a las startups a pasar de prototipos a despliegue empresarial más rápido. Empiecen hoy mismo con Microsoft for Startups.