Fundación en formación Custodia interina: Celiums Solutions LLC Leer el estado legal

Sistema de software 03 / Inferencia

Redes ternarias en CPU, con matemática exacta y memoria usada deliberadamente.

Hyphae BitNet es el repositorio básico para el tiempo de ejecución actual de celiums-bitnet: generación de una sola vez, servicio HTTP nativo, una ABI C experimental y puntos de referencia de precarga/decodificación.

Haga que los modelos ternarios admitidos sean operativos en servidores de CPU normales sin convertir los núcleos aproximados, el crecimiento descontrolado de la RAM o los componentes internos heredados del motor en un comportamiento oculto del producto.

01 / Benefits

Por qué existe el runtime

El ancho de banda de la memoria es el objetivo

Los pesos ternarios empaquetados reducen los bytes transmitidos por token; Los diseños informáticos gastan RAM solo cuando la ruta del hardware se beneficia.

Acumulación exacta

I2_S uses (D−S)ρ and Q1 uses 2P−S with integer accumulation; approximate LUT-GEMM and T-MAC stay outside strict mode.

Presupuestos de RAM cerrados ante fallos

La carga del modelo o la creación de sesiones se niegan a exceder el límite del conjunto de trabajo configurado en lugar de inutilizar el host.

Carga familiar

Las combinaciones de arquitectura y tipos de archivos admitidas son explícitas; Se rechazan los modelos Llama/Qwen Q4 normales y los formatos Q2 en colisión.

Interfaces propiedad del producto

Las aplicaciones utilizan la CLI celiums-bitnet, C ABI o el subconjunto HTTP nativo en lugar de vincularse a elementos internos de GGML.

Recibos antes de la comercialización

Los puntos de referencia incluyen resúmenes de modelos, límite de RAM, CPU/ISA, división de precarga/decodificación, JSON sin formato y no reclamaciones explícitas.

02 / Architecture

Cómo fluye la inferencia por el runtime

El GGUF empaquetado sigue siendo el almacenamiento persistente. Una disposición de cálculo en memoria opcional y sujeta a presupuesto se adapta a la ISA de la CPU; el prefill y la decodificación usan kernels diferentes.

  1. 01

    GGUF validado

    I2_S BitNet or Q1_0 Bonsai; architecture, type, revision, and digest remain operator-visible

  2. 02

    Puerta de presupuesto

    ram_budget reserva el espacio libre del host y falla antes de la asignación si el diseño seleccionado no cabe

  3. 03

    Imagen de cálculo ISA

    ARM i8mm expande Q1 a int8 ±1; x86 VNNI mantiene paneles de 4×8 llenos de bits; I2_S usa rutas estrictas tinyBLAS

  4. 04

    Precarga

    GEMM reutiliza cada panel de peso en ocho y luego cuatro filas de activación

  5. 05

    Descodificar

    GEMV maneja un token y transmite la imagen de peso una vez; Las optimizaciones de precarga no pretenden acelerar la decodificación.

  6. 06

    Tiempo de ejecución público

    Tokenizar, precompletar, decodificar, logits, muestreo, cancelación, streaming de devoluciones de llamadas, bancos HTTP/SSE y JSONL

03 / Surface

Superficie de producto compatible

BitNet 2B certificado

Microsoft BitNet b1.58 2B en MOSTLY_I2_S con identidad de conversión fijada y puertas de exactitud.

Texto de la CPU Bonsai 27B

Familia Q1_0 Qwen35 precuantizada con signos de 1 bit, escalas de bloque FP16, atención DeltaNet plus y selección de familia explícita.

Tiempo de ejecución y servicio

Generación de una sola vez, subconjunto de chat/completación HTTP nativo, SSE, claves API, métricas, secuencias de detención y cancelación cooperativa.

Puerta de enlace Hyphae opcional

Un proceso de Rust separado puede agregar recuperación, memoria, recibos, registro, pruebas, caché semántica y MCP sin vincular Hyphae a GGML.

04 / Evidence

Efectos medidos en hardware

El prefill y la decodificación tienen distintos límites de rendimiento. Los registros publicados informan de ambos y conservan los casos en que una disposición mejora una fase pero perjudica la otra.

5.6×

Precarga Graviton 4 en un hilo

Q1 expand-to-int8 vs packed mmap

2.3×

Graviton 4 decodifica en un hilo

un alto número de hilos puede retroceder

+8.6%

Precarga de Xeon en un hilo

8-row vs 4-row GEMM

64 B

presupuesto fallido deliberado

rechazado antes de la asignación del modelo

Las cifras de Graviton y Xeon se aplican solo a los modelos, resúmenes, máquinas, recuentos de subprocesos, longitudes de mensajes/generación y límite de 64 GiB mencionados. Ampliar Q1 puede reducir la decodificación de subprocesos altos cuando la DRAM se satura.

05 / Lo que hace hoy

Lo que hace hoy

  • Ejecuta BitNet 2B I2_S certificado y la familia de texto de CPU Bonsai 27B Q1_0 explícita.
  • Proporciona comandos CLI run/serve/bench/validate/version, una ABI C experimental y un subconjunto HTTP en forma de OpenAI.
  • Selecciona perfiles de CPU nativos, AVX2 portátiles o escalares y diseños informáticos presupuestados.
  • Valida el comportamiento exacto del kernel a través de oráculos escalares/genéricos, desinfectantes, pruebas de paquetes y puertas de lanzamiento respaldadas por modelos.
06 / Lo que pretende hacer

Lo que pretende hacer

  • Compare mosaicos de kernel exactos adicionales y cuantificación de activación compartida.
  • Explore la compactación exacta de canal cero y codificaciones ternarias más densas sin poda aproximada.
  • Evalúe AMX como una ruta de solo llenado previo mientras mantiene empaquetados los pesos persistentes.
  • Programación madura de secuencias múltiples y propiedad de solicitudes asincrónicas.
  • Mueva las rutas de GPU de experimentos heredados a núcleos I2_S genéricos y explícitamente probados antes de las reclamaciones de soporte.
07 / Límites explícitos

Lo que deliberadamente rechaza

  • No es un corredor de modelo llama.cpp arbitrario; Se rechazan las combinaciones de arquitectura/cuantización no compatibles.
  • No se admite inferencia de GPU, procesamiento por lotes continuo, API OpenAI completa, incrustaciones, herramientas, logprobs o TLS integrado en el producto actual.
  • No se afirma ninguna identidad bit a bit universal en las ISA ni en la certificación de punto de control de origen.
  • Los artefactos binarios y de lanzamiento públicos actuales conservan el nombre del producto celiums-bitnet; el repositorio de la fundación no borra la propiedad del modelo o del upstream.

Hyphae BitNet

Haga que los modelos ternarios admitidos sean operativos en servidores de CPU normales sin convertir los núcleos aproximados, el crecimiento descontrolado de la RAM o los componentes internos heredados del motor en un comportamiento oculto del producto.