Die Speicherbandbreite ist das Ziel
Gepackte ternäre Gewichte reduzieren die pro Token gestreamten Bytes; Compute-Layouts verbrauchen nur dann RAM, wenn der Hardware-Pfad davon profitiert.
Softwaresystem 03 / Inferenz
Hyphae BitNet ist das Basis-Repository für die aktuelle Celiums-Bitnet-Laufzeit: One-Shot-Generierung, native HTTP-Bereitstellung, ein experimentelles C-ABI und Vorfüll-/Dekodierungs-Benchmarks.
Machen Sie unterstützte ternäre Modelle auf normalen CPU-Servern betriebsbereit, ohne ungefähre Kernel, unkontrolliertes RAM-Wachstum oder übernommene Engine-Interna in verstecktes Produktverhalten umzuwandeln.
01 / Benefits
Gepackte ternäre Gewichte reduzieren die pro Token gestreamten Bytes; Compute-Layouts verbrauchen nur dann RAM, wenn der Hardware-Pfad davon profitiert.
I2_S uses (D−S)ρ and Q1 uses 2P−S with integer accumulation; approximate LUT-GEMM and T-MAC stay outside strict mode.
Das Laden des Modells oder die Sitzungserstellung weigert sich, die konfigurierte Obergrenze für den Arbeitssatz zu überschreiten, anstatt den Host unbrauchbar zu machen.
Unterstützte Architektur- und Dateitypkombinationen sind explizit; Gewöhnliche Llama/Qwen-Q4-Modelle und kollidierende Q2-Formate werden abgelehnt.
Anwendungen verwenden die Celiums-Bitnet-CLI, C ABI oder die native HTTP-Teilmenge, anstatt an GGML-Interna zu binden.
Zu den Benchmarks gehören Modell-Digests, RAM-Obergrenze, CPU/ISA, Prefill-/Decode-Split, Roh-JSON und explizite Nichtansprüche.
02 / Architecture
Verpacktes GGUF bleibt der dauerhafte Speicher. Ein optionales, budgetiertes In-Memory-Rechenlayout entspricht der CPU-ISA; Vorfüllen und dekodieren und dann unterschiedliche Kernel verwenden.
I2_S BitNet or Q1_0 Bonsai; architecture, type, revision, and digest remain operator-visible
ram_budget reserviert Host-Headroom und schlägt vor der Zuweisung fehl, wenn das ausgewählte Layout nicht passt
ARM i8mm erweitert Q1 auf int8 ±1; x86 VNNI sorgt für bitgepackte 4×8-Panels; I2_S verwendet strikte tinyBLAS-Pfade
GEMM verwendet jedes Gewichtsfeld über acht und dann vier Aktivierungsreihen hinweg wieder
GEMV verarbeitet ein Token und streamt das Gewichtsbild einmal; Prefill-Optimierungen geben nicht vor, die Dekodierung zu beschleunigen
Tokenisieren, Vorfüllen, Dekodieren, Logits, Sampling, Stornierung, Streaming-Rückrufe, HTTP/SSE- und JSONL-Bänke
03 / Surface
Microsoft BitNet b1.58 2B in MOSTLY_I2_S mit angehefteten Konvertierungsidentitäts- und Genauigkeitstoren.
Vorquantisierte Q1_0 Qwen35-Familie mit 1-Bit-Vorzeichen, FP16-Blockskalen, DeltaNet plus Aufmerksamkeit und expliziter Familienauswahl.
One-Shot-Generierung, native HTTP-Vervollständigung/Chat-Teilmenge, SSE, API-Schlüssel, Metriken, Stoppsequenzen und kooperativer Abbruch.
Ein separater Rust-Prozess kann Abruf, Speicher, Belege, Registrierung, Beweise, semantischen Cache und MCP hinzufügen, ohne Hyphae mit GGML zu verknüpfen.
04 / Evidence
Vorfüllung und Dekodierung haben unterschiedliche Dachlinien. Die veröffentlichten Belege berichten über beides und bewahren Fälle, in denen ein Layout einer Phase hilft, einer anderen jedoch schadet.
Q1 expand-to-int8 vs packed mmap
Hohe Fadenzahlen können sich zurückbilden
8-row vs 4-row GEMM
vor Modellvergabe abgelehnt
Die Graviton- und Durch die Erweiterung von Q1 kann die High-Thread-Dekodierung reduziert werden, wenn der DRAM ausgelastet ist.
Hyphae BitNet