財団設立準備中 暫定管理:Celiums Solutions LLC 状況説明を読む

ソフトウェアシステム03 / 推論

CPU 上の 3 値ネットワーク。正確な計算とメモリが意図的に使用されます。

Hyphae BitNet は、現在の celiums-bitnet ランタイムの基盤リポジトリです。ワンショット生成、ネイティブ HTTP サービス、実験的な C ABI、プレフィル/デコード ベンチマークなどを備えています。

近似カーネル、制御されていない RAM の増加、または継承されたエンジン内部を隠れた製品動作に変えることなく、サポートされている 3 値モデルを通常の CPU サーバー上で動作させることができます。

01 / Benefits

ランタイムの目的

メモリ帯域幅が目標です

パックされた 3 値の重みにより、トークンごとにストリーミングされるバイト数が削減されます。コンピューティング レイアウトは、ハードウェア パスにメリットがある場合にのみ RAM を消費します。

正確な累積

I2_S uses (D−S)ρ and Q1 uses 2P−S with integer accumulation; approximate LUT-GEMM and T-MAC stay outside strict mode.

フェールクローズされた RAM バジェット

モデルの読み込みまたはセッションの作成は、ホストを使用不能にする代わりに、構成されたワーキングセットの上限を超えることを拒否します。

モデルファミリー制限付きロード

サポートされるアーキテクチャとファイル タイプの組み合わせは明示的です。通常の Llama/Qwen Q4 モデルと衝突する Q2 フォーマットは拒否されます。

製品所有のインターフェース

アプリケーションは、GGML 内部にバインドする代わりに、celiums-bitnet CLI、C ABI、またはネイティブ HTTP サブセットを使用します。

宣伝より先に測定証跡を

ベンチマークには、モデル ダイジェスト、RAM キャップ、CPU/ISA、プリフィル/デコード分割、生の JSON、および明示的な非クレームが含まれます。

02 / Architecture

ランタイム内の推論経路

パックされた GGUF は耐久性のあるストアのままです。オプションの予算に応じたインメモリ コンピューティング レイアウトは、CPU ISA と一致します。プリフィルとデコードを行ってから、異なるカーネルを使用します。

  1. 01

    検証済みの GGUF

    I2_S BitNet or Q1_0 Bonsai; architecture, type, revision, and digest remain operator-visible

  2. 02

    予算ゲート

    ram_budget はホストのヘッドルームを予約しますが、選択したレイアウトが適合しない場合は割り当て前に失敗します。

  3. 03

    ISA コンピューティング イメージ

    ARM i8mm は Q1 を int8 ±1 に拡張します。 x86 VNNI はビットパックされた 4×8 パネルを保持します。 I2_S は厳密な tinyBLAS パスを使用します

  4. 04

    プレフィル

    GEMM は、各ウェイト パネルを 8 行と 4 行のアクティベーション行にわたって再利用します。

  5. 05

    デコード

    GEMV は 1 つのトークンを処理し、重み画像を 1 回ストリーミングします。プレフィルの最適化はデコードを高速化するふりをしません

  6. 06

    パブリックランタイム

    トークン化、プレフィル、デコード、ロジット、サンプリング、キャンセル、ストリーミング コールバック、HTTP/SSE、および JSONL ベンチ

03 / Surface

対応する製品範囲

認定済み BitNet 2B

Microsoft BitNet b1.58 2B (MOSTLY_I2_S) (ピン留めされた変換 ID と正確性ゲートを備え)。

Bonsai 27B CPUテキスト

1 ビット符号、FP16 ブロック スケール、DeltaNet プラス アテンション、明示的なファミリー選択を備えた事前量子化 Q1_0 Qwen35 ファミリ。

ランタイムとサービス提供

ワンショット生成、ネイティブ HTTP 完了/チャット サブセット、SSE、API キー、メトリクス、停止シーケンス、および協調キャンセル。

オプションの菌糸ゲートウェイ

別の Rust プロセスでは、Hyphae を GGML にリンクせずに、取得、メモリ、レシート、レジストリ、プルーフ、セマンティック キャッシュ、および MCP を追加できます。

04 / Evidence

測定されたハードウェア効果

プリフィルとデコードには異なるルーフラインがあります。公開されたレシートは両方を報告しており、レイアウトがあるフェーズでは役に立ちますが、別のフェーズでは害を及ぼすケースを保存しています。

5.6×

1 つのスレッドでの Graviton 4 プレフィル

Q1 expand-to-int8 vs packed mmap

2.3×

Graviton 4 は 1 つのスレッドでデコードします

スレッド数が多いと退行する可能性がある

+8.6%

1 つのスレッドでの Xeon プレフィル

8-row vs 4-row GEMM

64 B

意図的に予算を無視する

モデル割り当て前に拒否されました

Graviton および Xeon の数値は、指定されたモデル、ダイジェスト、マシン、スレッド数、プロンプト/生成の長さ、および 64 GiB の上限にのみ適用されます。 Q1 を拡張すると、DRAM が飽和した場合のハイスレッド デコードを減らすことができます。

05 / 現在できること

現在できること

  • 認定された BitNet 2B I2_S および明示的な Bonsai 27B Q1_0 CPU テキスト ファミリを実行します。
  • CLI の run/serve/bench/validate/version コマンド、実験的な C ABI、および OpenAI 形式の HTTP サブセットを提供します。
  • ネイティブ、ポータブル AVX2、またはスカラー CPU プロファイルと予算に応じたコンピューティング レイアウトを選択します。
  • スカラー/汎用オラクル、サニタイザー、パッケージ テスト、モデルに基づくリリース ゲートを通じて、カーネルの正確な動作を検証します。
06 / 今後の方向性

今後の方向性

  • 追加の正確なカーネル タイルと共有アクティベーション量子化を比較します。
  • 近似的な枝刈りを行わずに、正確なゼロチャネル圧縮とより高密度な 3 値エンコーディングを探索します。
  • 永続化された重みをパックしたままにして、AMX をプレフィル専用パスとして評価します。
  • 成熟したマルチシーケンスのスケジューリングと非同期リクエストの所有権。
  • サポートを主張する前に、継承された実験から汎用の明示的にテストされた I2_S カーネルに GPU パスを移動します。
07 / 明示的な境界

意図的に拒否しているもの

  • 任意の llama.cpp モデル ランナーではありません。サポートされていないアーキテクチャ/量子化の組み合わせは拒否されます。
  • 現在の製品では、GPU 推論、連続バッチ処理、完全な OpenAI API、埋め込み、ツール、logprob、または組み込み TLS はサポートされていません。
  • ISA 間でのユニバーサルなビット単位の ID やソースチェックポイントの認証は主張しません。
  • 現在のパブリック バイナリとリリース アーティファクトは、celiums-bitnet 製品名を保持します。基盤リポジトリは、アップストリームまたはモデルの所有権を消去しません。

Hyphae BitNet

近似カーネル、制御されていない RAM の増加、または継承されたエンジン内部を隠れた製品動作に変えることなく、サポートされている 3 値モデルを通常の CPU サーバー上で動作させることができます。