मेमोरी बैंडविड्थ लक्ष्य है
पैक्ड टर्नरी वेट प्रति टोकन स्ट्रीम किए गए बाइट्स को कम करते हैं; कंप्यूट लेआउट रैम तभी खर्च करते हैं जब हार्डवेयर पथ लाभान्वित होता है।
सॉफ्टवेयर सिस्टम 03/अनुमान
हाइफ़े बिटनेट वर्तमान सेलियम-बिटनेट रनटाइम के लिए आधार भंडार है: एक-शॉट पीढ़ी, मूल HTTP सेवा, एक प्रयोगात्मक सी एबीआई, और प्रीफ़िल/डीकोड बेंचमार्क।
अनुमानित कर्नेल, अनियंत्रित रैम वृद्धि, या विरासत में मिले इंजन आंतरिक को छिपे हुए उत्पाद व्यवहार में बदले बिना सामान्य सीपीयू सर्वर पर समर्थित टर्नरी मॉडल को चालू करें।
01 / Benefits
पैक्ड टर्नरी वेट प्रति टोकन स्ट्रीम किए गए बाइट्स को कम करते हैं; कंप्यूट लेआउट रैम तभी खर्च करते हैं जब हार्डवेयर पथ लाभान्वित होता है।
I2_S uses (D−S)ρ and Q1 uses 2P−S with integer accumulation; approximate LUT-GEMM and T-MAC stay outside strict mode.
मॉडल लोड या सत्र निर्माण होस्ट को अनुपयोगी बनाने के बजाय कॉन्फ़िगर किए गए वर्किंग-सेट कैप से अधिक होने से इंकार कर देता है।
समर्थित आर्किटेक्चर और फ़ाइल-प्रकार संयोजन स्पष्ट हैं; साधारण लामा/क्यूवेन क्यू4 मॉडल और टकराने वाले क्यू2 प्रारूपों को अस्वीकार कर दिया गया है।
एप्लिकेशन जीजीएमएल इंटर्नल से बाइंडिंग के बजाय सेलियम-बिटनेट सीएलआई, सी एबीआई, या मूल HTTP सबसेट का उपयोग करते हैं।
बेंचमार्क में मॉडल डाइजेस्ट, रैम कैप, सीपीयू/आईएसए, प्रीफिल/डीकोड स्प्लिट, कच्चा JSON और स्पष्ट गैर-दावा शामिल हैं।
02 / Architecture
पैक्ड जीजीयूएफ टिकाऊ स्टोर बना हुआ है। एक वैकल्पिक, बजटयुक्त इन-मेमोरी कंप्यूट लेआउट सीपीयू आईएसए से मेल खाता है; पहले से भरें और डीकोड करें फिर अलग-अलग कर्नेल का उपयोग करें।
I2_S BitNet or Q1_0 Bonsai; architecture, type, revision, and digest remain operator-visible
ram_budget होस्ट हेडरूम को सुरक्षित रखता है और यदि चयनित लेआउट फिट नहीं हो पाता है तो आवंटन से पहले विफल हो जाता है
ARM i8mm Q1 को int8 ±1 तक विस्तारित करता है; x86 वीएनएनआई बिट-पैक्ड 4×8 पैनल रखता है; I2_S सख्त tinyBLAS पथों का उपयोग करता है
GEMM प्रत्येक भार पैनल को आठ और फिर चार सक्रियण पंक्तियों में पुन: उपयोग करता है
GEMV एक टोकन को संभालता है और वजन छवि को एक बार स्ट्रीम करता है; प्रीफ़िल अनुकूलन डिकोड में तेजी लाने का दिखावा नहीं करता है
टोकनाइज़, प्रीफ़िल, डीकोड, लॉगिट्स, सैंपलिंग, कैंसिलेशन, स्ट्रीमिंग कॉलबैक, HTTP/SSE, और JSONL बेंच
03 / Surface
Microsoft BitNet b1.58 2B MOSTLY_I2_S में पिन किए गए रूपांतरण पहचान और सटीकता गेट के साथ।
1-बिट संकेतों, एफपी16 ब्लॉक स्केल, डेल्टानेट प्लस ध्यान और स्पष्ट पारिवारिक चयन के साथ पूर्व-मात्राबद्ध Q1_0 Qwen35 परिवार।
एक-शॉट पीढ़ी, मूल HTTP पूर्णता/चैट सबसेट, एसएसई, एपीआई कुंजी, मेट्रिक्स, स्टॉप अनुक्रम और सहकारी रद्दीकरण।
एक अलग रस्ट प्रक्रिया हाइफ़े को जीजीएमएल में लिंक किए बिना पुनर्प्राप्ति, मेमोरी, रसीदें, रजिस्ट्री, सबूत, सिमेंटिक कैश और एमसीपी जोड़ सकती है।
04 / Evidence
प्रीफिल और डीकोड की रूफलाइन अलग-अलग होती है। प्रकाशित रसीदें दोनों की रिपोर्ट करती हैं और उन मामलों को संरक्षित करती हैं जहां एक लेआउट एक चरण में मदद करता है लेकिन दूसरे को नुकसान पहुंचाता है।
Q1 expand-to-int8 vs packed mmap
उच्च थ्रेड गिनती पुनः प्राप्त हो सकती है
8-row vs 4-row GEMM
मॉडल आवंटन से पहले मना कर दिया
ग्रेविटॉन और ज़ीऑन के आंकड़े केवल नामित मॉडल, डाइजेस्ट, मशीन, थ्रेड काउंट, प्रॉम्प्ट/जेनरेशन लंबाई और 64 GiB कैप पर लागू होते हैं। DRAM संतृप्त होने पर Q1 का विस्तार करने से हाई-थ्रेड डिकोड कम हो सकता है।
Hyphae BitNet