Cómo desplegar Fireworks AI en Microsoft Foundry: un plan de arquitectura para startups

Fireworks AI en Microsoft Foundry: una arquitectura práctica para startups

Publicado en Microsoft para Startups.

Muchas startups comienzan a construir productos de IA con un único modelo cerrado como una manera rápida de prototipar. Pero la selección de modelos para cargas de trabajo de aplicaciones es una decisión que se acumula a lo largo del ciclo de vida de un producto y determina los costes futuros y la diferenciación del producto.

Los modelos abiertos les permiten tomar esa decisión de manera más deliberada: ustedes eligen el modelo, lo ajustan a su caso de uso y moldean el comportamiento que distingue a su producto. Con Fireworks AI en Microsoft Foundry ya disponible a nivel general, pueden ofrecer inferencia de modelos abiertos de alto rendimiento y baja latencia directo en Azure. No necesitan construir su propia infraestructura de inferencia para ejecutar modelos abiertos aquí; Fireworks les sirve en Foundry, así que pueden empezar rápido y escalar esa huella a medida que avanzan.

Para ayudar, introducimos nuevos recursos para startups nativas de IA sobre cómo desplegar y servir modelos de Fireworks en Foundry y escalar desde prototipo hasta producción.

Plan de implementación diseñado para startups nativas de IA

Arquitectura de referencia que muestra una aplicación cliente conectada a una interfaz de chat, un servidor de API y un proceso de trabajo en Azure Container Apps. Estos componentes llaman a un punto de conexión de un modelo de Fireworks AI en Microsoft Foundry. El diagrama incluye el catálogo de modelos, la administración de implementaciones, la gobernanza, las cuotas, la facturación de Azure y las capacidades del punto de conexión de Fireworks AI. Los servicios opcionales incluyen Azure Key Vault para secretos y administración de claves, Azure Monitor para métricas de latencia, errores, uso de tokens y reintentos, Azure API Management para límites de frecuencia y cuotas, y Azure Cache for Redis para reducir llamadas de inferencia redundantes.

El plan de implementación para desplegar modelos de IA de Fireworks muestra cómo los ingenieros fundadores y los pequeños equipos pueden pasar de la idea al MVP y al ajuste producto-mercado (PMF, por sus siglas en inglés) a través de la utilización de un enfoque repetible y nativo de Azure. La experiencia comienza de manera sencilla y crece según sus necesidades, así que ustedes son responsables de su inteligencia desde el principio.

La pila se ejecuta por completo dentro de su entorno Azure y solo requiere un endpoint modelo para la infraestructura o el harness de su aplicación. Empiecen con el despliegue de un único modelo, enrutar el tráfico a través de la Gestión de API, y seguir las métricas de latencia, uso y costes a lo largo del proceso. Cuando estén listos, pueden escalar con Azure Cache para Redis para reducir la inferencia redundante, a través de la introducción de ajustes de rendimiento según la carga de trabajo y desplegar múltiples variantes de modelos para pruebas A/B.

Los modelos de Fireworks se despliegan a través de Foundry dentro de su suscripción a Azure, por lo que el descubrimiento, la gobernanza y la facturación del modelo permanecen en un único plano de control.

ComponentePropósito
Microsoft Foundry + Modelos de IA FireworksFoundry proporciona la plataforma nativa de Azure para el despliegue, la gobernanza y la facturación; Fireworks son la capa de inferencia que sirve a los modelos abiertos que hay detrás de ellos
Azure Container AppsAloja la aplicación o API que envía solicitudes de inferencia
Azure Container RegistryAlmacena imágenes de contenedores
Azure Key VaultAlmacena credenciales e información de endpoints de manera segura
Azure Monitor (opcional)Proporciona observabilidad y conocimiento del rendimiento

Por qué las startups necesitan una arquitectura flexible de inferencia de IA

La inferencia es uno de los mayores factores de coste controlables para las empresas nativas de IA. Las decisiones tempranas sobre cómo se sirven los modelos pueden crear restricciones a largo plazo en costes, latencia y flexibilidad. Esta arquitectura está diseñada para abordar estos desafíos desde el principio. Servir modelos abiertos de esta manera mantiene esas decisiones en sus manos, para que puedan elegir, optimizar y cambiar los modelos detrás de su producto a medida que cambien sus necesidades de coste y rendimiento.

Optimizar el coste desde el primer día

  • Utilicen inferencia serverless y de pago por token a través de Foundry con una selección de modelos abiertos
  • Ajusten las cargas de trabajo al modelo más rentable y eviten estar atado a un solo proveedor de modelos
  • Almacenar en caché las solicitudes repetidas con Azure Cache para Redis para reducir el uso de cómputo
  • Rastrear el coste por millón de tokens como métrica central de ingeniería

Eliminar la sobrecarga de infraestructura

  • No hace falta levantarse ni gestionar clústeres de GPU
  • Fireworks proporciona inferencia de alto rendimiento, mientras que Foundry proporciona gobernanza, seguridad y gestión del ciclo de vida

Mantener la flexibilidad mientras escalas

  • Experimentar y cambiar de modelo mediante APIs y flujos de despliegue consistentes, para que el intercambio requiera menos reestructuración
  • Soportar pesos personalizados o para traer su propio modelo cuando sea necesario
  • Pasar de la experimentación a la producción en la misma plataforma
  • Una vez que la carga de trabajo está bien comprendida, sus suites de evaluación, bibliotecas de prompts y tráfico de producción graduado son datos de entrenamiento: los equipos pueden afinar y optimizar un modelo mediante Fireworks Training y luego importar a Azure al traer sus propios pesos.

Construir y probar aplicaciones de IA con menos presión inicial de costes

Para los equipos del programa Microsoft for Startups, esta arquitectura desbloquea una ventaja significativa. Pueden aplicar sus créditos de inicio a despliegues de modelos Fireworks a través de Data Zone Standard (las unidades de rendimiento provisionadas, o PTU, tienen capacidad reservada y no están cubiertas por créditos de startup), así como la infraestructura de Azure de apoyo.

Esto significa que pueden construir y probar aplicaciones de IA de calidad productiva, experimentar con múltiples modelos para encontrar dónde los modelos abiertos les dan la ventaja adecuada de coste y rendimiento antes de escalar, e iterar con rapidez hacia el ajuste producto-mercado, sin introducir presión inmediata sobre los costes de infraestructura.

Construyan con Microsoft para startups

Si están en el proceso de desarrollo de aplicaciones de IA en Azure, nos encantaría conocer más sobre su visión y ayudarles a acelerar su camino.

Microsoft for Startups ayuda a los fundadores a construir rápido, de manera inteligente y a vender más gracias a créditos de startup, infraestructura de IA Azure, orientación técnica y recursos de comercialización diseñados para ayudar a las startups a pasar de prototipos a despliegue empresarial más rápido. Empiecen hoy mismo con Microsoft for Startups.

Español (España)
Icono de exclusión de opciones de privacidad Tus opciones de privacidad
Privacidad de la salud del consumidor Ponte en contacto con Microsoft Privacidad Gestionar cookies Condiciones de uso Marcas registradas Sobre nuestra publicidad Docs de cumplimiento de la UE