Fondation en cours de formation Garde provisoire : Celiums Solutions LLC Lire la note de statut

Système logiciel 03 / Inférence

Réseaux ternaires sur processeurs, avec calculs exacts et mémoire utilisés délibérément.

Hyphae BitNet est le référentiel de base du runtime celiums-bitnet actuel : génération unique, service HTTP natif, un ABI C expérimental et des tests de pré-remplissage/décodage.

Rendre les modèles ternaires pris en charge opérationnels sur des serveurs CPU ordinaires sans transformer les noyaux approximatifs, la croissance incontrôlée de la RAM ou les composants internes du moteur hérités en un comportement de produit caché.

01 / Benefits

Pourquoi ce runtime existe

La bande passante mémoire est la cible

Les poids ternaires compressés réduisent le nombre d'octets diffusés par jeton ; les configurations de calcul dépensent de la RAM uniquement lorsque le chemin matériel en profite.

Accumulation exacte

I2_S uses (D−S)ρ and Q1 uses 2P−S with integer accumulation; approximate LUT-GEMM and T-MAC stay outside strict mode.

Budgets RAM fermés en cas d'échec

Le chargement du modèle ou la création de session refuse de dépasser le plafond de l'ensemble de travail configuré au lieu de rendre l'hôte inutilisable.

Chargement limité par famille

L'architecture prise en charge et les combinaisons de types de fichiers sont explicites ; Les modèles ordinaires Llama/Qwen Q4 et les formats Q2 entrants en collision sont refusés.

Interfaces appartenant au produit

Les applications utilisent la CLI celiums-bitnet, le C ABI ou le sous-ensemble HTTP natif au lieu de se lier aux composants internes de GGML.

Preuves avant marketing

Les références incluent les résumés de modèles, la limite de RAM, le CPU/ISA, la répartition pré-remplissage/décodage, le JSON brut et les non-revendications explicites.

02 / Architecture

Chemin de l’inférence dans le runtime

Le GGUF emballé reste le magasin durable. Une disposition de calcul en mémoire facultative et budgétisée correspond à l'ISA du processeur ; préremplir et décoder puis utiliser différents noyaux.

  1. 01

    GGUF validé

    I2_S BitNet or Q1_0 Bonsai; architecture, type, revision, and digest remain operator-visible

  2. 02

    Porte budgétaire

    ram_budget réserve la marge de l'hôte et échoue avant l'allocation si la mise en page sélectionnée ne peut pas tenir

  3. 03

    Image de calcul ISA

    ARM i8mm étend Q1 à int8 ±1 ; x86 VNNI conserve des panneaux 4×8 remplis de bits ; I2_S utilise des chemins tinyBLAS stricts

  4. 04

    Prefill

    GEMM réutilise chaque panneau de poids sur huit puis quatre rangées d'activation

  5. 05

    Décodage

    GEMV gère un jeton et diffuse l'image de poids une fois ; les optimisations de pré-remplissage ne prétendent pas accélérer le décodage

  6. 06

    Exécution publique

    Tokenisation, pré-remplissage, décodage, logits, échantillonnage, annulation, rappels en streaming, bancs HTTP/SSE et JSONL

03 / Surface

Périmètre produit pris en charge

Certifié BitNet 2B

Microsoft BitNet b1.58 2B dans MOSTLY_I2_S avec portes d'identité et d'exactitude de conversion épinglées.

Texte du processeur Bonsai 27B

Famille Q1_0 Qwen35 pré-quantifiée avec signes 1 bit, échelles de blocs FP16, DeltaNet plus attention et sélection explicite de famille.

Durée d'exécution et service

Génération ponctuelle, sous-ensemble de complétion HTTP/chat natif, SSE, clés API, métriques, séquences d'arrêt et annulation coopérative.

Passerelle Hyphae en option

Un processus Rust distinct peut ajouter la récupération, la mémoire, les reçus, le registre, les preuves, le cache sémantique et MCP sans lier Hyphae à GGML.

04 / Evidence

Effets matériels mesurés

Le pré-remplissage et le décodage ont des lignes de toit différentes. Les reçus publiés rapportent les deux et préservent les cas où une mise en page aide une phase mais nuit à une autre.

5.6×

Pré-remplissage Graviton 4 sur un seul fil

Q1 expand-to-int8 vs packed mmap

2.3×

Graviton 4 décode sur un seul thread

un nombre élevé de threads peut régresser

+8.6%

Pré-remplissage Xeon sur un thread

8-row vs 4-row GEMM

64 B

budget délibérément défaillant

refusé avant l'attribution du modèle

Les chiffres Graviton et Xeon s'appliquent uniquement aux modèles, résumés, machines, nombres de threads, longueurs d'invite/génération et à la limite de 64 Gio nommés. L’extension de Q1 peut réduire le décodage à thread élevé lorsque la DRAM sature.

05 / Ce qu’il fait aujourd’hui

Ce qu’il fait aujourd’hui

  • Exécute le BitNet 2B I2_S certifié et la famille de texte CPU explicite Bonsai 27B Q1_0.
  • Fournit des commandes CLI run/serve/bench/validate/version, un C ABI expérimental et un sous-ensemble HTTP en forme d'OpenAI.
  • Sélectionne les profils de processeur natifs, portables AVX2 ou scalaires et les configurations de calcul budgétisées.
  • Valide le comportement exact du noyau via des oracles scalaires/génériques, des désinfectants, des tests de packages et des portes de publication basées sur un modèle.
06 / Ce qu’il prévoit

Ce qu’il prévoit

  • Comparez les tuiles de noyau exactes supplémentaires et la quantification d'activation partagée.
  • Explorez le compactage exact du canal zéro et les codages ternaires plus denses sans élagage approximatif.
  • Évaluez AMX en tant que chemin de pré-remplissage uniquement tout en conservant les pondérations persistantes emballées.
  • Planification multi-séquence mature et propriété des requêtes asynchrones.
  • Déplacez les chemins GPU des expériences héritées vers des noyaux I2_S génériques et explicitement testés avant les réclamations de support.
07 / Limites explicites

Ce qu'il refuse délibérément

  • Il ne s'agit pas d'un exécuteur de modèle arbitraire lama.cpp ; les combinaisons architecture/quantification non prises en charge sont rejetées.
  • Aucune inférence GPU prise en charge, traitement par lots continu, API OpenAI complète, intégrations, outils, logprobs ou TLS intégré dans le produit actuel.
  • Aucune revendication d'identité universelle au niveau des bits à travers les ISA ou de certification de point de contrôle source.
  • Les artefacts binaires et de version publics actuels conservent le nom du produit celiums-bitnet ; le référentiel de fondation n'efface pas la propriété en amont ou du modèle.

Hyphae BitNet

Rendre les modèles ternaires pris en charge opérationnels sur des serveurs CPU ordinaires sans transformer les noyaux approximatifs, la croissance incontrôlée de la RAM ou les composants internes du moteur hérités en un comportement de produit caché.