Reflection presenta Beam: Un nuevo contendiente de pesos abiertos
Reflection ha lanzado Beam, un modelo de mezcla de expertos disperso de 501 mil millones de parámetros con 23 mil millones de parámetros activos. La arquitectura activa solo una fracción de sus pesos totales por paso hacia adelante, apuntando a la eficiencia de inferencia sin sacrificar la capacidad típicamente asociada con los modelos densos de frontera.
La empresa posiciona el modelo Beam como un competidor directo de los principales lanzamientos de pesos abiertos chinos, enfatizando requisitos de cómputo más bajos para el entrenamiento y la implementación. Reflection destaca la codificación, el razonamiento complejo y los flujos de trabajo agénticos como casos de uso principales, áreas donde los diseños de MoE disperso han tenido históricamente dificultades para igualar la fiabilidad de los modelos densos.
Estas capacidades preparan el escenario para una mirada más profunda a los fundamentos técnicos del modelo.
Arquitectura Técnica e Innovaciones en el Entrenamiento

Beam sufrió un preentrenamiento en 23,8 billones de tokens antes de entrar en una fase de aprendizaje por refuerzo que se ejecutó en un clúster de 10.500 nodos de GPUs NVIDIA GB300, generando más de 100 millones de rollouts. Los ingenieros introdujeron un método de gradiente de política asíncrono para mantener la enorme flota utilizada sin los bloqueos de sincronización que típicamente cuellan las ejecuciones a esta escala.
Un parámetro de esfuerzo de razonamiento controlable permite a los desarrolladores ajustar el gasto computacional del modelo hacia arriba o hacia abajo en el momento de la inferencia, intercambiando latencia por profundidad de pensamiento por base de solicitud. A pesar del nombre compartido, el modelo no tiene relación con el Apache Beam, el modelo unificado de programación para procesamiento de datos por lotes y streaming.
Con estas decisiones arquitectónicas en su lugar, ahora podemos resumir las especificaciones clave del modelo.
Datos clave: Modelo Beam a simple vista
- Arquitectura: Mezcla de expertos dispersa con 501B de parámetros totales y 23B de parámetros activos por paso hacia adelante
- Cálculo de entrenamiento: Preentrenado en 23,8 billones de tokens; fase de RL ejecutada en un clúster de 10.500 nodos de NVIDIA GB300 que generó 100M+ rollouts
- Posicionamiento en benchmarks: Apunta a la paridad con GLM-5.2, Qwen 3.8-Max y Kimi K3 en codificación, razonamiento complejo y flujos de trabajo agénticos
- Reclamos de eficiencia: El método de gradiente de política asíncrono reduce la sobrecarga de sincronización; el parámetro de esfuerzo de razonamiento controlable ajusta el cómputo de inferencia de forma dinámica
- Licencia: Publicado bajo Apache 2.0 para uso comercial e investigativo
- Contexto del ecosistema: Llega junto a otros avances de pesos abiertos como Qwen Image Edit, ampliando el kit de herramientas de modelos abiertos para tareas multimodales y de lenguaje
Tras describir los atributos principales, el siguiente paso es examinar el roadmap de Reflection y sus próximas versiones.
Qué sigue para el roadmap de Inteligencia Abierta de Reflection
Reflection planea publicar los pesos completos de Beam bajo la licencia existente Apache 2.0 dentro del próximo trimestre, acompañado de una tarjeta de modelo detallada que documente la composición de los datos de entrenamiento, el presupuesto de cómputo y las limitaciones conocidas. La empresa ha firmado acuerdos de distribución con Hugging Face, AWS Marketplace y Azure AI Model Catalog para garantizar una implementación con un solo clic en las principales plataformas en la nube, mientras que los parches de integración nativa para vLLM, SGLang y TensorRT-LLM ya están en revisión en el repositorio upstream.
Una evaluación de seguridad de terceros realizada por el AI Security Institute se publicará junto con los pesos, cubriendo las tasas de rechazo, la robustez frente a jailbreaks y los umbrales de capacidad para vectores de riesgo químico, biológico, radiológico y nuclear. Reflection afirma que Beam representa el primer hito de un compromiso plurianual para avanzar la frontera abierta, con un sucesor de 1 billón de parámetros ya en pretraining temprano que apunta a mejorar la agencia a largo plazo y el razonamiento multimodal.
Preguntas frecuentes
¿Cómo se compara la eficiencia de inferencia de Beam con GLM-5.2 en despliegues del mundo real?
Beam utiliza una arquitectura de mezcla de expertos dispersa que activa solo 23 B de sus 501 B de parámetros por paso hacia adelante, reduciendo el cómputo y la latencia en comparación con el denso GLM-5.2. El entrenamiento de gradiente de política asíncrono y el parámetro de esfuerzo de razonamiento controlable reducen aún más el costo de inferencia, permitiendo que Beam iguale o supere el rendimiento de GLM-5.2 en tareas de codificación y razonamiento mientras utiliza menos hardware.
¿Qué hardware y pila de software se requieren para ejecutar Beam de manera eficiente en tiempo de inferencia?
Beam está optimizado para clústeres de GPU; la configuración de referencia utiliza GPUs NVIDIA GB300, pero el modelo puede ejecutarse en cualquier GPU reciente de clase A100 o H100 con suficiente VRAM para alojar los 23 B de parámetros activos. Los parches de integración para vLLM, SGLang y TensorRT‑LLM están en revisión, lo que permite un servicio de baja latencia en marcos de inferencia populares.
¿Cómo afecta el parámetro de esfuerzo de razonamiento controlable a la calidad de la salida y la latencia de Beam?
El parámetro de esfuerzo de razonamiento permite a los desarrolladores escalar la cantidad de cómputo asignado por solicitud, intercambiando latencia por un razonamiento más profundo y preciso. Los ajustes más altos activan más expertos y una generación de tokens más larga, mejorando la resolución de problemas complejos, mientras que los ajustes más bajos aceleran las respuestas con una ligera disminución en la profundidad de la respuesta.
Last Updated on octubre 6, 2026 2:23 pm by Laszlo Szabo / NowadAIs | Published on octubre 6, 2026 by Laszlo Szabo / NowadAIs

