8美元ESP32-S3跑起2890万参数大模型!致敬 slvDev,我让它学会了“说中文”

📅 2026/8/4 18:01:24
8美元ESP32-S3跑起2890万参数大模型!致敬 slvDev,我让它学会了“说中文”
大家都在讨论大模型需要多少张显卡时开发者 slvDev 已经悄悄把一个 2890 万参数的语言模型塞进了一块售价仅约 8 美元的 ESP32-S3 微控制器里。作为边缘 AI 的爱好者我在 slvDev 原版项目的基础上进行了深度改造将其从 MicroPython 环境迁移到了更底层的 ESP-IDF 框架并成功让它学会了“说中文”。今天我把这个名为 ESP32-AI-IDF 的中文改造版分享给大家。站在巨人的肩膀上从英文到中文的跨越slvDev 的原版项目非常惊艳但主要支持英文和 MicroPython。为了追求更极致的性能和更灵活的开发体验我将其重构到了 ESP-IDF 环境。为了让模型“听懂”中文我引入了 Hugging Face 上的 TinyStoriesZh 中文数据集进行训练。大家可以直接下载这份测试数据wget https://hf-mirror.com/datasets/52AI/TinyStoriesZh/resolve/main/TinyStories_all_data_zh_2M.tar.gz?downloadtrue性能实测与双语言支持在实际测试中这个运行在 ESP32-S3 上的中文模型生成速度大约在 3 token/s。虽然绝对速度不快但在一个微控制器上实现本地 AI 交互这已经迈出了关键一步。当然项目也保留了英文环境的支持。如果你更习惯英文只需替换模型文件和 vocab.h_en 词表即可无缝切换。核心训练参数公开避坑指南项目自带了训练好的模型但我也非常鼓励大家自己动手训练。以下是我使用的原始项目参数如果你也想复现可以直接参考python train.py --arm ple \--d-model 96 \--n-layers 6 \--n-heads 4 \--ffn-hidden 66 \--ple-dim 128 \--vocab 4096 \--steps 4000⚠️ 几个避坑的关键参数--ffn-hidden 66必须与原始项目严格匹配这是模型能在 ESP32 上跑起来的最核心参数--d-model 96 与 --ple-dim 128同样是匹配原始项目的关键维度。--vocab 4096这里我替换成了中文分词器。测试效果需要用putty 串口查看中文欢迎来玩代码我已经全部开源或者一起探讨边缘 AI 的更多可能8美元ESP32-S3跑起2890万参数大模型致敬 slvDev我让它学会了“说中文”