La atención dispersa Naive-N0.5-Flash permite modelado de IA con un millón de tokens

La atención dispersa Naive-N0.5-Flash permite modelado de IA con un millón de tokens

Presentando Naive-N0.5-Flash: Modelo de IA Construido para Contextos de Millón de Tokens

NaiveAI ha lanzado Naive-N0.5-Flash, un modelo de mezcla de expertos de 309 mil millones de parámetros con 15.5 mil millones de parámetros activos, desarrollado mediante un pipeline de investigación y desarrollo centrado en IA. La arquitectura aprovecha una ventana de contexto nativa de 1 millón de tokens impulsada por un mecanismo de atención esparsa diseñado para mantener la fidelidad de recuperación en secuencias ultra-largas sin depender de aproximaciones de ventana deslizante.

El modelo se dirige a flujos de trabajo de ingeniería de software e investigación en IA que requieren razonamiento holístico sobre bases de código masivas, documentación extensa y dependencias multi-repositorio. Al mantener el contexto completo activo durante la inferencia, el sistema tiene como objetivo eliminar la fragmentación típicamente introducida por estrategias de fragmentación, permitiendo a los desarrolladores depurar, refactorizar y generar código con conciencia de todo el historial del proyecto.

Para comprender cómo se logra esta capacidad, nos enfocamos en el mecanismo de atención esparsa novedoso del modelo, que sustenta el manejo de contextos de millón de tokens.

Cómo la atención esparsa de Naive-N0.5-Flash logra un modelado eficiente de un millón de tokens

El modelo implementa una arquitectura de atención híbrida que combina la atención de ventana deslizante (SWA) con la atención esparsa de DeepSeek (DSA) bajo atención de consulta agrupada con cuatro grupos (GQA4). SWA preserva el contexto local denso dentro de una ventana fija, mientras que DSA introduce un indexador ligero aprendido para seleccionar un pequeño conjunto de tokens globalmente relevantes para cada consulta, reduciendo drásticamente el costo cuadrático de la atención completa. Este diseño permite que los 15.500 millones de parámetros activos atiendan a lo largo de toda la ventana de un millón de tokens sin la pérdida de fidelidad típica de las aproximaciones puramente basadas en ventana.

El entrenamiento se lleva a cabo en tres etapas: una fase inicial de preentrenamiento denso establece las capacidades básicas del lenguaje; una etapa de continuación de contexto largo extiende la ventana efectiva utilizando el mecanismo híbrido SWA-DSA; y una última pasada de ajuste fino de atención esparsa optimiza el indexador y el enrutador para la precisión de recuperación. En la inferencia, el motor NaiveRT activa un modo ultrafuso que fusiona la búsqueda del indexador con patrones de esparsidad a nivel de kernel, ofreciendo un escalado sublineal y permitiendo la implementación práctica de contextos de un millón de tokens en clústeres de GPU de uso común. Más detalles arquitectónicos están disponibles en las notas oficiales de lanzamiento y en un análisis profundo del diseño subyacente de atención esparsa de DeepSeek V3.

El siguiente resumen conciso captura las especificaciones y métricas de rendimiento del modelo.

Key Facts

  • Architecture: 309B total parameters, 15.5B active parameters (Mixture-of-Experts)
  • Context window: 1 million tokens via Naive-N0.5-Flash sparse attention (hybrid SWA + DSA with GQA4)
  • Training data: 12 trillion tokens across three stages (dense pre-training, long-context continuation, sparse-attention fine-tuning)
  • License: Apache 2.0 (open weights)
  • API pricing: $0.15 per million input tokens, $0.60 per million output tokens via NaiveAI platform
  • Evaluation highlights: 92.3% pass rate on Needle-in-a-Haystack (1M tokens), 78.4% on SWE-bench Verified, 89.1% on MMLU-Pro

Beyond the raw numbers, the broader implications for AI research and development become clear.

Qué significa Naive-N0.5-Flash para la investigación y el desarrollo de IA

El lanzamiento de Naive-N0.5-Flash señala un cambio hacia arquitecturas diseñadas por IA que optimizan sus propios grafos computacionales, pasando la atención esparsa de un artefacto de investigación ajustado manualmente a una primitiva de ingeniería reproducible. Al demostrar que un indexador aprendido puede enrutar de manera confiable consultas a lo largo de un horizonte de un millón de tokens, el modelo valida un camino donde la búsqueda de arquitecturas y la compilación consciente del hardware convergen, potencialmente acortando el ciclo desde el avance teórico hasta la implementación en producción.

Esta capacidad beneficia directamente a los flujos de trabajo agénticos que requieren memoria persistente y de alta fidelidad en bucles de interacción extendidos. Los agentes de codificación de largo horizonte, los pipelines de síntesis de múltiples documentos y los sistemas de aprendizaje continuo ahora pueden mantener el contexto relevante sin recurrir a heurísticas frágiles de recuperación aumentada o a resúmenes agresivos que descartan matices. La licencia Apache 2.0 acelera aún más esta trayectoria al permitir a los investigadores ablatar el componente de atención esparsa de DeepSeek frente a conjuntos de datos y objetivos de hardware personalizados.

Para los equipos que construyen sobre estos avances, un sólido dominio de la mecánica subyacente del transformador sigue siendo esencial; comprender cómo se desplazan las distribuciones de atención bajo restricciones de esparsidad es más fácil con una base en cómo funcionan los grandes modelos de lenguaje. A medida que los patrones esparsos se convierten en bloques de construcción estándar, es probable que el enfoque de la comunidad migre de demostrar viabilidad a optimizar los trade-offs entre la latencia del indexador, la entropía del enrutador y la fidelidad de las tareas posteriores en diversos dominios.

Preguntas frecuentes

¿Cuál es la estructura de costos para usar Naive‑N0.5‑Flash con entradas y salidas de un millón de tokens, y cómo se compara con otros modelos de contexto grande?

Naive‑N0.5‑Flash tiene un precio de $0.15 por millón de tokens de entrada y $0.60 por millón de tokens de salida en la plataforma NaiveAI. Esto es generalmente más bajo que muchos servicios propietarios de un millón de tokens, que a menudo cobran entre $0.30 y $0.40 por entrada y entre $0.80 y $1.20 por salida. La tarifa escalonada lo hace atractivo para análisis intensivo de bases de código y tareas de razonamiento de forma extensa.

¿En qué se diferencia la arquitectura de atención híbrida de Naive‑N0.5‑Flash del enfoque puro de atención esparsa de DeepSeek?

Naive‑N0.5‑Flash combina la atención de ventana deslizante (SWA) para el contexto local denso con la atención esparsa de DeepSeek (DSA) para la selección global de tokens, todo bajo un esquema de atención de consulta agrupada (GQA4). El diseño original de DeepSeek se basa únicamente en un indexador aprendido sin el componente local de SWA, lo que puede pasar por alto detalles finos. El diseño híbrido preserva la fidelidad local mientras logra un escalado sublineal en una ventana de un millón de tokens.

¿Qué requisitos de hardware y límites prácticos deben esperar los usuarios al implementar Naive‑N0.5‑Flash para contextos de un millón de tokens en GPUs de consumo?

El motor NaiveRT ofrece un escalado sublineal, pero el modelo aún necesita suficiente memoria de GPU para alojar los 15.5 mil millones de parámetros activos y los mapas de atención esparsa, lo que generalmente requiere entre 40 y 80 GB de VRAM por GPU. Las configuraciones de múltiples GPUs pueden particionar el contexto, pero la latencia aumenta si la búsqueda del indexador se convierte en un cuello de botella. En la práctica, los usuarios pueden ejecutar inferencia completa de un millón de tokens en una sola GPU de alta gama o en un clúster modesto de GPUs con un ajuste cuidadoso del tamaño del lote.

Laszlo Szabo / NowadAIs

Laszlo Szabo is an AI technology analyst with 6+ years covering artificial intelligence developments. Specializing in large language models, ML benchmarking, and Artificial Intelligence industry analysis

Categories

Follow us on Facebook!

HomeBody VLM uniendo visión y acción para generalización de habilidades robóticas
Previous Story

HomeBody VLM: Uniendo visión y acción para la generalización de habilidades robóticas

Tasa de éxito del 29,2 % Ataques a la cadena de suministro GPT-6 Astra - ¿Qué tan peligroso es?
Next Story

Tasa de éxito del 29,2 %: Ataques a la cadena de suministro de GPT-6 Astra – ¿Qué tan peligroso es?

Latest from Blog

Go toTop