L'obiettivo è la larghezza di banda della memoria
I pesi ternari compressi riducono i byte trasmessi in streaming per token; i layout di calcolo consumano RAM solo quando il percorso hardware ne trae vantaggio.
Sistema software 03 / Inferenza
Hyphae BitNet è il repository di base per l'attuale runtime celiums-bitnet: generazione one-shot, servizio HTTP nativo, un ABI C sperimentale e benchmark di precompilazione/decodifica.
Rendi operativi i modelli ternari supportati su normali server CPU senza trasformare kernel approssimativi, crescita incontrollata della RAM o componenti interni ereditati del motore in comportamenti nascosti del prodotto.
01 / Benefits
I pesi ternari compressi riducono i byte trasmessi in streaming per token; i layout di calcolo consumano RAM solo quando il percorso hardware ne trae vantaggio.
I2_S uses (D−S)ρ and Q1 uses 2P−S with integer accumulation; approximate LUT-GEMM and T-MAC stay outside strict mode.
Il caricamento del modello o la creazione della sessione rifiuta di superare il limite del set di lavoro configurato invece di rendere l'host inutilizzabile.
L'architettura supportata e le combinazioni di tipi di file sono esplicite; I modelli ordinari Llama/Qwen Q4 e i formati Q2 in collisione vengono rifiutati.
Le applicazioni utilizzano la CLI celiums-bitnet, C ABI o il sottoinsieme HTTP nativo invece di legarsi agli interni GGML.
I benchmark includono digest del modello, limite RAM, CPU/ISA, suddivisione precompilazione/decodifica, JSON non elaborato e non rivendicazioni esplicite.
02 / Architecture
GGUF pieno rimane il negozio durevole. Un layout di calcolo in memoria opzionale e preventivato corrisponde all'ISA della CPU; precompilare e decodificare quindi utilizzare kernel diversi.
I2_S BitNet or Q1_0 Bonsai; architecture, type, revision, and digest remain operator-visible
ram_budget riserva spazio per l'host e fallisce prima dell'allocazione se il layout selezionato non può adattarsi
ARM i8mm espande Q1 in int8 ±1; x86 VNNI mantiene i pannelli 4×8 bit-packed; I2_S utilizza percorsi tinyBLAS rigorosi
GEMM riutilizza ciascun pannello del peso su otto e poi su quattro righe di attivazione
GEMV gestisce un token e trasmette in streaming l'immagine del peso una volta; le ottimizzazioni di precompilazione non pretendono di accelerare la decodifica
Tokenizzazione, precompilazione, decodifica, logit, campionamento, cancellazione, callback in streaming, bench HTTP/SSE e JSONL
03 / Surface
Microsoft BitNet b1.58 2B in MOSTLY_I2_S con porte di identità e precisione di conversione bloccate.
Famiglia Q1_0 Qwen35 prequantizzata con segni a 1 bit, scale a blocchi FP16, DeltaNet più attenzione e selezione esplicita della famiglia.
Generazione one-shot, completamento HTTP nativo/sottoinsieme chat, SSE, chiavi API, metriche, sequenze di arresto e cancellazione cooperativa.
Un processo Rust separato può aggiungere recupero, memoria, ricevute, registro, prove, cache semantica e MCP senza collegare Hyphae a GGML.
04 / Evidence
La precompilazione e la decodifica hanno linee del tetto diverse. Le ricevute pubblicate riportano entrambi e preservano i casi in cui un layout aiuta una fase ma ne danneggia un'altra.
Q1 expand-to-int8 vs packed mmap
un numero elevato di thread può regredire
8-row vs 4-row GEMM
rifiutato prima dell'assegnazione del modello
Le cifre di Graviton e Xeon si applicano solo ai modelli, ai digest, alle macchine, ai conteggi di thread, alle lunghezze di prompt/generazione e al limite di 64 GiB indicati. L'espansione di Q1 può ridurre la decodifica high-thread quando la DRAM è satura.
Hyphae BitNet