재단 설립 준비 중 임시 관리: Celiums Solutions LLC 상태 안내 읽기

소프트웨어 시스템 03 / 추론

정확한 수학과 메모리를 의도적으로 사용하는 CPU의 삼항 네트워크입니다.

Hyphae BitNet은 현재 celiums-bitnet 런타임(원샷 생성, 기본 HTTP 제공, 실험적 C ABI 및 사전 채우기/디코드 벤치마크)을 위한 기반 저장소입니다.

대략적인 커널, 제어되지 않는 RAM 증가 또는 상속된 엔진 내부를 숨겨진 제품 동작으로 전환하지 않고도 일반 CPU 서버에서 지원되는 삼항 모델이 작동하도록 만듭니다.

01 / Benefits

런타임의 목적

메모리 대역폭이 목표입니다

압축된 삼항 가중치는 토큰당 스트리밍되는 바이트를 줄입니다. 컴퓨팅 레이아웃은 하드웨어 경로가 도움이 될 때만 RAM을 소비합니다.

정확한 축적

I2_S uses (D−S)ρ and Q1 uses 2P−S with integer accumulation; approximate LUT-GEMM and T-MAC stay outside strict mode.

장애 폐쇄 RAM 예산

모델 로드 또는 세션 생성은 호스트를 사용할 수 없게 만드는 대신 구성된 작업 세트 한도를 초과하는 것을 거부합니다.

모델 계열 제한 로딩

지원되는 아키텍처와 파일 유형 조합은 명시적입니다. 일반 Llama/Qwen Q4 모델과 충돌하는 Q2 형식은 거부됩니다.

제품 소유 인터페이스

애플리케이션은 GGML 내부에 바인딩하는 대신 celiums-bitnet CLI, C ABI 또는 기본 HTTP 하위 집합을 사용합니다.

마케팅보다 근거 기록을 먼저

벤치마크에는 모델 다이제스트, RAM 한도, CPU/ISA, 사전 채우기/디코드 분할, 원시 JSON 및 명시적 비클레임이 포함됩니다.

02 / Architecture

런타임 내 추론 흐름

Packed GGUF는 내구성 있는 저장소로 남아 있습니다. 선택 사항이며 예산이 책정된 인메모리 컴퓨팅 레이아웃은 CPU ISA와 일치합니다. 미리 채우고 디코딩한 다음 다른 커널을 사용합니다.

  1. 01

    검증된 GGUF

    I2_S BitNet or Q1_0 Bonsai; architecture, type, revision, and digest remain operator-visible

  2. 02

    예산 게이트

    ram_budget은 호스트 헤드룸을 예약하고 선택한 레이아웃이 맞지 않으면 할당 전에 실패합니다.

  3. 03

    ISA 컴퓨팅 이미지

    ARM i8mm은 Q1을 int8 ±1로 확장합니다. x86 VNNI는 비트 팩형 4×8 패널을 유지합니다. I2_S는 엄격한tinyBLAS 경로를 사용합니다.

  4. 04

    프리필

    GEMM은 8~4개의 활성화 행에 걸쳐 각 가중치 패널을 재사용합니다.

  5. 05

    디코드

    GEMV는 하나의 토큰을 처리하고 체중 이미지를 한 번 스트리밍합니다. 사전 채우기 최적화는 디코딩 속도를 높이는 척하지 않습니다.

  6. 06

    공개 런타임

    토큰화, 미리 채우기, 디코딩, 로짓, 샘플링, 취소, 스트리밍 콜백, HTTP/SSE 및 JSONL 벤치

03 / Surface

지원 제품 범위

인증된 BitNet 2B

고정된 변환 ID 및 정확성 게이트가 있는 MOSTLY_I2_S의 Microsoft BitNet b1.58 2B.

분재 27B CPU 텍스트

1비트 부호, FP16 블록 스케일, DeltaNet 플러스 어텐션 및 명시적 패밀리 선택을 갖춘 사전 양자화된 Q1_0 Qwen35 제품군입니다.

런타임 및 서빙

원샷 생성, 기본 HTTP 완료/채팅 하위 집합, SSE, API 키, 메트릭, 중지 시퀀스 및 협력 취소.

선택적 Hyphae 게이트웨이

별도의 Rust 프로세스는 Hyphae를 GGML에 연결하지 않고도 검색, 메모리, 영수증, 레지스트리, 증명, 의미 캐시 및 MCP를 추가할 수 있습니다.

04 / Evidence

측정된 하드웨어 효과

프리필과 디코드의 루프라인은 서로 다릅니다. 게시된 영수증은 레이아웃이 한 단계에는 도움이 되지만 다른 단계에는 해를 끼치는 경우를 모두 보고하고 보존합니다.

5.6×

하나의 스레드에서 Graviton 4 프리필

Q1 expand-to-int8 vs packed mmap

2.3×

하나의 스레드에서 Graviton 4 디코드

스레드 수가 많으면 회귀할 수 있음

+8.6%

하나의 스레드에서 Xeon 사전 채우기

8-row vs 4-row GEMM

64 B

고의적인 예산 실패

모델 할당 전에 거부됨

Graviton 및 Xeon 수치는 명명된 모델, 다이제스트, 머신, 스레드 수, 프롬프트/생성 길이 및 64GiB 한도에만 적용됩니다. Q1을 확장하면 DRAM이 포화될 때 높은 스레드 디코드를 줄일 수 있습니다.

05 / 현재 기능

현재 기능

  • 인증된 BitNet 2B I2_S 및 명시적인 Bonsai 27B Q1_0 CPU 텍스트 제품군을 실행합니다.
  • CLI run/serve/bench/validate/version 명령, 실험적인 C ABI 및 OpenAI 형태의 HTTP 하위 집합을 제공합니다.
  • 기본, 휴대용 AVX2 또는 스칼라 CPU 프로필과 예산이 책정된 컴퓨팅 레이아웃을 선택합니다.
  • 스칼라/일반 오라클, 새니타이저, 패키지 테스트 및 모델 지원 릴리스 게이트를 통해 정확한 커널 동작을 검증합니다.
06 / 향후 방향

향후 방향

  • 추가적인 정확한 커널 타일과 공유 활성화 양자화를 비교합니다.
  • 대략적인 가지치기 없이 정확한 제로 채널 압축과 밀도가 높은 삼항 인코딩을 탐색하세요.
  • 지속적인 가중치를 팩킹한 상태로 유지하면서 AMX를 사전 채우기 전용 경로로 평가합니다.
  • 성숙한 다중 시퀀스 스케줄링 및 비동기 요청 소유권.
  • 지원 요청 전에 GPU 경로를 상속된 실험에서 명시적으로 테스트된 일반 I2_S 커널로 이동합니다.
07 / 명시적 경계

고의로 거부하는 것

  • 임의의 llama.cpp 모델 실행기가 아닙니다. 지원되지 않는 아키텍처/양자화 조합은 거부됩니다.
  • 현재 제품에서는 GPU 추론, 연속 일괄 처리, 완전한 OpenAI API, 임베딩, 도구, logprob 또는 내장 TLS가 지원되지 않습니다.
  • ISA 또는 소스 체크포인트 인증 전반에 걸쳐 범용 비트 단위 ID를 주장하지 않습니다.
  • 현재 공개 바이너리 및 릴리스 아티팩트는 celiums-bitnet 제품 이름을 유지합니다. 기초 저장소는 업스트림 또는 모델 소유권을 지우지 않습니다.

Hyphae BitNet

대략적인 커널, 제어되지 않는 RAM 증가 또는 상속된 엔진 내부를 숨겨진 제품 동작으로 전환하지 않고도 일반 CPU 서버에서 지원되는 삼항 모델이 작동하도록 만듭니다.