Neutrino-1 8B模型:2026年7月27日可用,多平台支持且性能卓越!

📅 2026/7/29 7:44:39
Neutrino-1 8B模型:2026年7月27日可用,多平台支持且性能卓越!
【Fermion Research相关导航】有模型、研究、新闻室、招聘信息等导航栏。还有X、Hugging Face、GitHub等社交链接以及运行Neutrino - 1 8B的入口。Neutrino - 1 8B将于2026年7月27日可用。【Neutrino-1 8B概述】Neutrino系列的旗舰产品采用编码三元系列容器有36个解码器层一个工件可支持数据中心GPU、MacBook和桌面CPU。可运行有发布说明可阅读。其大小为2.56GB下载无损fp16的比特数为1/8MMLU得分72.1H100规格解码速度763 tok/s。它还有概述、架构、格式等多方面介绍。【Neutrino-1 8B详细信息】【概述详情】Neutrino - 1 8B是仅含解码器的变压器模型有81.9亿个参数以3.88GB文件发布。252个变压器线性层用专有三元系列权重格式存储比fp16小8倍权重静止时位压缩矩阵内核中解码解码路径无fp16或fp32权重存储内容。小权重改变服务经济性单流解码受令牌移动字节数限制3.88GB工作集解码速度更快整个模型可与KV缓存存于8GB GPU或16GB笔记本电脑同一容器支持多平台。【架构详情】这是密集的仅含解码器的变压器模型。分组查询注意力使KV缓存为查询宽度四分之一fp16下每个令牌144 KiB4k令牌会话除3.88GB权重外需0.60GB缓存。基础模型是Apache - 2.0许可、阿里云的Qwen3 - 8B。参数包括6950万个编码投影权重、1.24亿个int8嵌入等总计8190735360个。解码器层数36隐藏宽度4096等。字节分布方面变压器线性层采用编码格式两个嵌入张量保持int8格式文件三分之一是词汇表。编码通道内部6950万个编码权重中62.63%为零正负值比例分别为18.68%和18.69%不同投影零值比例不同。【格式详情】一个容器有三种访问方式。下载的是编码传输文件可精确扩展为运行文件能在数据中心GPU和笔记本电脑运行。下载大小2.56GB磁盘存储3.88GB。分发方式有pip引擎、GGUF包 CUDA分支、MLX包不同方式在不同设备上有不同速度。【评估详情】发布版本评估在禁用思考功能下对发布容器进行评估协议涵盖多个方面。评估指标包括MMLU、MMLU - Redux等各有对应得分。评估于2026年7月在标准公共测试平台进行方法详见模型卡片。【吞吐量详情】单流解码速度决定提示和回复处理速度不同平台和访问方式有不同速度如H100 80GB在草稿模式下速度为763 tok/s等。这些是2026年7月的单流解码速度数据。【推测解码详情】Neutrino - 1 0.6B生成令牌草案8B模型评分并保留一致前缀输出流与普通贪心算法相同。加速效果取决于草案接受率不同提示类别有不同速度和加速倍数。配对成本方面草案模型可与验证模型在同一进程有相应的驻留权重、草案额外成本等。在笔记本电脑上也可进行草案生成有相关的速度、接受率等数据。【运行方法与获取途径】运行方法可通过两条命令开启流式聊天还有本地OpenAI兼容服务器、选择模型等多种方式。获取模型可从Hugging Face、PyPI、GitHub等途径。【可用性及相关情况】Neutrino - 1 8B作为公共仓库发布2026年7月27日可用开放权重采用Apache 2.0许可。还有许可说明和引用格式。此外还有相关研究介绍可开始使用该模型体验前沿智能可通过电子邮件订阅新闻通讯有导航栏、公司信息、下载途径和联系方式等。