메모리 대역폭이 목표입니다
압축된 삼항 가중치는 토큰당 스트리밍되는 바이트를 줄입니다. 컴퓨팅 레이아웃은 하드웨어 경로가 도움이 될 때만 RAM을 소비합니다.
소프트웨어 시스템 03 / 추론
Hyphae BitNet은 현재 celiums-bitnet 런타임(원샷 생성, 기본 HTTP 제공, 실험적 C ABI 및 사전 채우기/디코드 벤치마크)을 위한 기반 저장소입니다.
대략적인 커널, 제어되지 않는 RAM 증가 또는 상속된 엔진 내부를 숨겨진 제품 동작으로 전환하지 않고도 일반 CPU 서버에서 지원되는 삼항 모델이 작동하도록 만듭니다.
01 / Benefits
압축된 삼항 가중치는 토큰당 스트리밍되는 바이트를 줄입니다. 컴퓨팅 레이아웃은 하드웨어 경로가 도움이 될 때만 RAM을 소비합니다.
I2_S uses (D−S)ρ and Q1 uses 2P−S with integer accumulation; approximate LUT-GEMM and T-MAC stay outside strict mode.
모델 로드 또는 세션 생성은 호스트를 사용할 수 없게 만드는 대신 구성된 작업 세트 한도를 초과하는 것을 거부합니다.
지원되는 아키텍처와 파일 유형 조합은 명시적입니다. 일반 Llama/Qwen Q4 모델과 충돌하는 Q2 형식은 거부됩니다.
애플리케이션은 GGML 내부에 바인딩하는 대신 celiums-bitnet CLI, C ABI 또는 기본 HTTP 하위 집합을 사용합니다.
벤치마크에는 모델 다이제스트, RAM 한도, CPU/ISA, 사전 채우기/디코드 분할, 원시 JSON 및 명시적 비클레임이 포함됩니다.
02 / Architecture
Packed GGUF는 내구성 있는 저장소로 남아 있습니다. 선택 사항이며 예산이 책정된 인메모리 컴퓨팅 레이아웃은 CPU ISA와 일치합니다. 미리 채우고 디코딩한 다음 다른 커널을 사용합니다.
I2_S BitNet or Q1_0 Bonsai; architecture, type, revision, and digest remain operator-visible
ram_budget은 호스트 헤드룸을 예약하고 선택한 레이아웃이 맞지 않으면 할당 전에 실패합니다.
ARM i8mm은 Q1을 int8 ±1로 확장합니다. x86 VNNI는 비트 팩형 4×8 패널을 유지합니다. I2_S는 엄격한tinyBLAS 경로를 사용합니다.
GEMM은 8~4개의 활성화 행에 걸쳐 각 가중치 패널을 재사용합니다.
GEMV는 하나의 토큰을 처리하고 체중 이미지를 한 번 스트리밍합니다. 사전 채우기 최적화는 디코딩 속도를 높이는 척하지 않습니다.
토큰화, 미리 채우기, 디코딩, 로짓, 샘플링, 취소, 스트리밍 콜백, HTTP/SSE 및 JSONL 벤치
03 / Surface
고정된 변환 ID 및 정확성 게이트가 있는 MOSTLY_I2_S의 Microsoft BitNet b1.58 2B.
1비트 부호, FP16 블록 스케일, DeltaNet 플러스 어텐션 및 명시적 패밀리 선택을 갖춘 사전 양자화된 Q1_0 Qwen35 제품군입니다.
원샷 생성, 기본 HTTP 완료/채팅 하위 집합, SSE, API 키, 메트릭, 중지 시퀀스 및 협력 취소.
별도의 Rust 프로세스는 Hyphae를 GGML에 연결하지 않고도 검색, 메모리, 영수증, 레지스트리, 증명, 의미 캐시 및 MCP를 추가할 수 있습니다.
04 / Evidence
프리필과 디코드의 루프라인은 서로 다릅니다. 게시된 영수증은 레이아웃이 한 단계에는 도움이 되지만 다른 단계에는 해를 끼치는 경우를 모두 보고하고 보존합니다.
Q1 expand-to-int8 vs packed mmap
스레드 수가 많으면 회귀할 수 있음
8-row vs 4-row GEMM
모델 할당 전에 거부됨
Graviton 및 Xeon 수치는 명명된 모델, 다이제스트, 머신, 스레드 수, 프롬프트/생성 길이 및 64GiB 한도에만 적용됩니다. Q1을 확장하면 DRAM이 포화될 때 높은 스레드 디코드를 줄일 수 있습니다.