基金会筹建中 临时托管:Celiums Solutions LLC 查看状态说明

软件系统03/推理

在 CPU 上运行三值网络:精确数学,审慎使用内存。

Hyphae BitNet 是当前 celiums-bitnet 运行时的基础存储库:一次性生成、本机 HTTP 服务、实验性 C ABI 和预填充/解码基准。

使受支持的三元模型在普通 CPU 服务器上运行,而无需将近似内核、不受控制的 RAM 增长或继承的引擎内部结构转变为隐藏的产品行为。

01 / Benefits

运行时为何存在

内存带宽是目标

打包三元权重减少了每个令牌传输的字节数;仅当硬件路径受益时,计算布局才会消耗 RAM。

精确积累

I2_S uses (D−S)ρ and Q1 uses 2P−S with integer accumulation; approximate LUT-GEMM and T-MAC stay outside strict mode.

超限即拒绝的 RAM 预算

模型加载或会话创建拒绝超出配置的工作集上限,而不是使主机无法使用。

按模型系列准入的加载

支持的架构和文件类型组合是明确的;拒绝普通 Llama/Qwen Q4 型号和碰撞 Q2 格式。

产品拥有的接口

应用程序使用 celiums-bitnet CLI、C ABI 或本机 HTTP 子集,而不是绑定到 GGML 内部。

先有测量凭证,再做宣传

基准包括模型摘要、RAM 上限、CPU/ISA、预填充/解码分割、原始 JSON 和显式非声明。

02 / Architecture

推理如何流经运行时

包装好的 GGUF 仍然是耐用存储。可选的、预算内存计算布局与 CPU ISA 相匹配;预填充和解码然后使用不同的内核。

  1. 01

    已验证的 GGUF

    I2_S BitNet or Q1_0 Bonsai; architecture, type, revision, and digest remain operator-visible

  2. 02

    预算门

    ram_budget 保留主机余量,如果所选布局不适合,则在分配之前失败

  3. 03

    ISA 计算图像

    ARM i8mm将Q1扩展为int8±1; x86 VNNI 保留位封装的 4×8 面板; I2_S 使用严格的tinyBLAS 路径

  4. 04

    预填充

    GEMM 在八个激活行和四个激活行中重复使用每个重量面板

  5. 05

    解码

    GEMV 处理一个令牌并传输一次权重图像;预填充优化不会假装加速解码

  6. 06

    公共运行时

    标记化、预填充、解码、登录、采样、取消、流回调、HTTP/SSE 和 JSONL 工作台

03 / Surface

受支持的产品范围

BitNet 2B 认证

MOSTLY_I2_S 中的 Microsoft BitNet b1.58 2B 具有固定的转换身份和精确性门。

盆景27B CPU文本

预量化 Q1_0 Qwen35 系列,具有 1 位符号、FP16 块尺度、DeltaNet 加注意力和显式系列选择。

运行时和服务

一次性生成、本机 HTTP 完成/聊天子集、SSE、API 密钥、指标、停止序列和协作取消。

可选的菌丝网关

单独的 Rust 进程可以添加检索、内存、收据、注册表、证明、语义缓存和 MCP,而无需将 Hyphae 链接到 GGML。

04 / Evidence

硬件实测效果

预填充和解码具有不同的屋顶线。公布的收据报告了两种情况,并保留了布局有助于一个阶段但损害另一个阶段的情况。

5.6×

Graviton 4 在一个线程中预填充

Q1 expand-to-int8 vs packed mmap

2.3×

Graviton 4 在一个线程上解码

高线程数可能会回归

+8.6%

在一个线程中预填充 Xeon

8-row vs 4-row GEMM

64 B

故意失败的预算

模型分配前被拒绝

Graviton 和 Xeon 数据仅适用于指定的模型、摘要、机器、线程数、提示/生成长度和 64 GiB 上限。扩大Q1可以在DRAM饱和时减少高线程解码。

05 / 当前能力

当前能力

  • 运行经过认证的 BitNet 2B I2_S 和显式 Bonsai 27B Q1_0 CPU 文本系列。
  • 提供 CLI run/serve/bench/validate/version 命令、实验性 C ABI 和 OpenAI 型 HTTP 子集。
  • 选择本机、便携式 AVX2 或标量 CPU 配置文件和预算计算布局。
  • 通过标量/通用预言机、消毒剂、包测试和模型支持的发布门来验证确切的内核行为。
06 / 发展方向

发展方向

  • 比较额外的精确内核块和共享激活量化。
  • 探索精确的零通道压缩和更密集的三元编码,而无需近似修剪。
  • 将 AMX 评估为仅预填充路径,同时保持持久的权重打包。
  • 成熟的多序列调度和异步请求所有权。
  • 在支持声明之前,将 GPU 路径从继承的实验移至通用、显式测试的 I2_S 内核。
07 / 明确边界

明确拒绝的范围

  • 不是任意的 llama.cpp 模型运行程序;不支持的架构/量化组合将被拒绝。
  • 当前产品不支持 GPU 推理、连续批处理、完整的 OpenAI API、嵌入、工具、logprobs 或内置 TLS。
  • 没有声称跨 ISA 或源检查点认证的通用按位身份。
  • 当前的公共二进制文件和发布工件保留了 celiums-bitnet 产品名称;基础存储库不会删除上游或模型所有权。

Hyphae BitNet

使受支持的三元模型在普通 CPU 服务器上运行,而无需将近似内核、不受控制的 RAM 增长或继承的引擎内部结构转变为隐藏的产品行为。