Fundação em formação Custódia interina: Celiums Solutions LLC Ler o status

Sistema de software 03 / Inferência

Redes ternárias em CPUs, com matemática exata e memória usada deliberadamente.

Hyphae BitNet é o repositório básico para o tempo de execução atual do celiums-bitnet: geração única, serviço HTTP nativo, um C ABI experimental e benchmarks de pré-preenchimento/decodificação.

Torne os modelos ternários suportados operacionais em servidores de CPU comuns sem transformar kernels aproximados, crescimento descontrolado de RAM ou componentes internos herdados do mecanismo em comportamento oculto do produto.

01 / Benefits

Por que o runtime existe

Largura de banda da memória é o alvo

Os pesos ternários compactados reduzem os bytes transmitidos por token; layouts de computação gastam RAM somente quando o caminho do hardware é beneficiado.

Acumulação exata

I2_S uses (D−S)ρ and Q1 uses 2P−S with integer accumulation; approximate LUT-GEMM and T-MAC stay outside strict mode.

Orçamentos de RAM com falha fechada

A carga do modelo ou a criação de sessão recusa-se a exceder o limite do conjunto de trabalho configurado em vez de tornar o host inutilizável.

Carregamento restrito por família

A arquitetura suportada e as combinações de tipo de arquivo são explícitas; modelos Llama/Qwen Q4 comuns e formatos Q2 em colisão são recusados.

Interfaces de propriedade do produto

Os aplicativos usam a CLI celiums-bitnet, C ABI ou subconjunto HTTP nativo em vez de vincular aos componentes internos do GGML.

Comprovantes antes do marketing

Os benchmarks incluem resumos de modelo, limite de RAM, CPU/ISA, divisão de pré-preenchimento/decodificação, JSON bruto e não declarações explícitas.

02 / Architecture

Como a inferência percorre o runtime

A GGUF embalada continua sendo a loja durável. Um layout de computação na memória opcional e orçado corresponde ao ISA da CPU; preencha e decodifique e use kernels diferentes.

  1. 01

    GGUF validado

    I2_S BitNet or Q1_0 Bonsai; architecture, type, revision, and digest remain operator-visible

  2. 02

    Portão do orçamento

    ram_budget reserva espaço para o host e falha antes da alocação se o layout selecionado não couber

  3. 03

    Imagem de computação ISA

    ARM i8mm expande Q1 para int8 ±1; x86 VNNI mantém painéis 4×8 compactos; I2_S usa caminhos tinyBLAS estritos

  4. 04

    Prefill

    GEMM reutiliza cada painel de peso em oito e quatro linhas de ativação

  5. 05

    Decodificação

    GEMV lida com um token e transmite a imagem de peso uma vez; otimizações de pré-preenchimento não pretendem acelerar a decodificação

  6. 06

    Tempo de execução público

    Tokenizar, preencher previamente, decodificar, logits, amostragem, cancelamento, retornos de chamada de streaming, bancos HTTP/SSE e JSONL

03 / Surface

Superfície de produto suportada

Certificado BitNet 2B

Microsoft BitNet b1.58 2B em MOSTLY_I2_S com identidade de conversão fixada e portas de exatidão.

Texto da CPU Bonsai 27B

Família Q1_0 Qwen35 pré-quantizada com sinais de 1 bit, escalas de bloco FP16, DeltaNet mais atenção e seleção explícita de família.

Tempo de execução e veiculação

Geração única, conclusão de HTTP/subconjunto de bate-papo nativo, SSE, chaves de API, métricas, sequências de parada e cancelamento cooperativo.

Gateway Hyphae opcional

Um processo Rust separado pode adicionar recuperação, memória, recibos, registro, provas, cache semântico e MCP sem vincular Hyphae ao GGML.

04 / Evidence

Efeitos medidos no hardware

O pré-preenchimento e a decodificação têm linhas de telhado diferentes. Os recibos publicados relatam ambos e preservam casos em que um layout ajuda uma fase, mas prejudica outra.

5.6×

Pré-preenchimento Graviton 4 em um thread

Q1 expand-to-int8 vs packed mmap

2.3×

Decodificação Graviton 4 em um thread

altas contagens de threads podem regredir

+8.6%

Pré-preenchimento Xeon em um thread

8-row vs 4-row GEMM

64 B

falha deliberada no orçamento

recusado antes da alocação do modelo

Os números Graviton e Xeon se aplicam apenas aos modelos nomeados, resumos, máquinas, contagens de threads, comprimentos de prompt/geração e limite de 64 GiB. A expansão do Q1 pode reduzir a decodificação de alto thread quando a DRAM satura.

05 / O que faz hoje

O que faz hoje

  • Executa BitNet 2B I2_S certificado e a família de texto explícita de CPU Bonsai 27B Q1_0.
  • Fornece comandos CLI run/serve/bench/validate/version, um C ABI experimental e um subconjunto HTTP em formato OpenAI.
  • Seleciona perfis de CPU nativos, portáteis AVX2 ou escalares e layouts de computação orçados.
  • Valida o comportamento exato do kernel por meio de oráculos escalares/genéricos, sanitizadores, testes de pacote e portas de lançamento baseadas em modelo.
06 / O que pretende fazer

O que pretende fazer

  • Compare blocos de kernel exatos adicionais e quantização de ativação compartilhada.
  • Explore compactação exata de canal zero e codificações ternárias mais densas sem poda aproximada.
  • Avalie o AMX como um caminho somente pré-preenchido, mantendo os pesos persistentes compactados.
  • Agendamento multisequência maduro e propriedade de solicitação assíncrona.
  • Mova os caminhos da GPU de experimentos herdados para kernels I2_S genéricos e explicitamente testados antes das reivindicações de suporte.
07 / Limites explícitos

O que recusa deliberadamente

  • Não é um executor de modelo llama.cpp arbitrário; combinações de arquitetura/quantização não suportadas são rejeitadas.
  • Nenhuma inferência de GPU suportada, lote contínuo, API OpenAI completa, incorporações, ferramentas, logprobs ou TLS integrado no produto atual.
  • Nenhuma reivindicação de identidade bit a bit universal entre ISAs ou certificação de ponto de verificação de origem.
  • Os atuais artefatos binários públicos e de lançamento mantêm o nome do produto celiums-bitnet; o repositório básico não apaga a propriedade do upstream ou do modelo.

Hyphae BitNet

Torne os modelos ternários suportados operacionais em servidores de CPU comuns sem transformar kernels aproximados, crescimento descontrolado de RAM ou componentes internos herdados do mecanismo em comportamento oculto do produto.