La bande passante mémoire est la cible
Les poids ternaires compressés réduisent le nombre d'octets diffusés par jeton ; les configurations de calcul dépensent de la RAM uniquement lorsque le chemin matériel en profite.
Système logiciel 03 / Inférence
Hyphae BitNet est le référentiel de base du runtime celiums-bitnet actuel : génération unique, service HTTP natif, un ABI C expérimental et des tests de pré-remplissage/décodage.
Rendre les modèles ternaires pris en charge opérationnels sur des serveurs CPU ordinaires sans transformer les noyaux approximatifs, la croissance incontrôlée de la RAM ou les composants internes du moteur hérités en un comportement de produit caché.
01 / Benefits
Les poids ternaires compressés réduisent le nombre d'octets diffusés par jeton ; les configurations de calcul dépensent de la RAM uniquement lorsque le chemin matériel en profite.
I2_S uses (D−S)ρ and Q1 uses 2P−S with integer accumulation; approximate LUT-GEMM and T-MAC stay outside strict mode.
Le chargement du modèle ou la création de session refuse de dépasser le plafond de l'ensemble de travail configuré au lieu de rendre l'hôte inutilisable.
L'architecture prise en charge et les combinaisons de types de fichiers sont explicites ; Les modèles ordinaires Llama/Qwen Q4 et les formats Q2 entrants en collision sont refusés.
Les applications utilisent la CLI celiums-bitnet, le C ABI ou le sous-ensemble HTTP natif au lieu de se lier aux composants internes de GGML.
Les références incluent les résumés de modèles, la limite de RAM, le CPU/ISA, la répartition pré-remplissage/décodage, le JSON brut et les non-revendications explicites.
02 / Architecture
Le GGUF emballé reste le magasin durable. Une disposition de calcul en mémoire facultative et budgétisée correspond à l'ISA du processeur ; préremplir et décoder puis utiliser différents noyaux.
I2_S BitNet or Q1_0 Bonsai; architecture, type, revision, and digest remain operator-visible
ram_budget réserve la marge de l'hôte et échoue avant l'allocation si la mise en page sélectionnée ne peut pas tenir
ARM i8mm étend Q1 à int8 ±1 ; x86 VNNI conserve des panneaux 4×8 remplis de bits ; I2_S utilise des chemins tinyBLAS stricts
GEMM réutilise chaque panneau de poids sur huit puis quatre rangées d'activation
GEMV gère un jeton et diffuse l'image de poids une fois ; les optimisations de pré-remplissage ne prétendent pas accélérer le décodage
Tokenisation, pré-remplissage, décodage, logits, échantillonnage, annulation, rappels en streaming, bancs HTTP/SSE et JSONL
03 / Surface
Microsoft BitNet b1.58 2B dans MOSTLY_I2_S avec portes d'identité et d'exactitude de conversion épinglées.
Famille Q1_0 Qwen35 pré-quantifiée avec signes 1 bit, échelles de blocs FP16, DeltaNet plus attention et sélection explicite de famille.
Génération ponctuelle, sous-ensemble de complétion HTTP/chat natif, SSE, clés API, métriques, séquences d'arrêt et annulation coopérative.
Un processus Rust distinct peut ajouter la récupération, la mémoire, les reçus, le registre, les preuves, le cache sémantique et MCP sans lier Hyphae à GGML.
04 / Evidence
Le pré-remplissage et le décodage ont des lignes de toit différentes. Les reçus publiés rapportent les deux et préservent les cas où une mise en page aide une phase mais nuit à une autre.
Q1 expand-to-int8 vs packed mmap
un nombre élevé de threads peut régresser
8-row vs 4-row GEMM
refusé avant l'attribution du modèle
Les chiffres Graviton et Xeon s'appliquent uniquement aux modèles, résumés, machines, nombres de threads, longueurs d'invite/génération et à la limite de 64 Gio nommés. L’extension de Q1 peut réduire le décodage à thread élevé lorsque la DRAM sature.
Hyphae BitNet