来源:互联网 更新时间:2026-08-02 13:19
上周,Meta 甩出 Llama 3 的时候,整个开源社区都沸腾了。号称“迄今最强的开源大模型”,在代码生成等多个关键基准测试上直接碾压同类模型——更复杂的推理能力、更好的指令遵循、甚至能可视化想法并解决微妙的问题。这次开源的两个版本:8B(80亿参数)和70B(700亿参数),可以说直接点燃了所有人的期待。
作为开源界的“全村希望”,Llama 3 一出,各路玩家立刻开始“试驾”。而今天要聊的这个案例,可能是最令人印象深刻的一个:在不到 100 美元的树莓派 5 上,跑起了 Llama 3 8B!
没错,就是那个巴掌大的迷你电脑。树莓派系列一直以袖珍体型和强大性能著称,而到了第 5 代,配置更强,还搭载了新定制的芯片。X 网友 @adamcohenhillel 做到了:Llama 3 8B 在树莓派 5 上以每秒 1.89 个 token 的速度运行,支持 8K 上下文窗口。看那响应——让模型向世界打个招呼,它很快回了一句:“HEY WORLD!How’s everyone doing today?”整个过程只用了 11.6 秒。对树莓派这类设备来说,这速度已经相当能打,足以满足一些实时应用需求。

<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3426908582221250563"></iframe>
不过,这位网友并没有公布在树莓派 5 上跑 Llama 3 8B 的详细步骤,但他推荐了另一份操作指南——如何在树莓派 5 上运行 Mistral 7B,完全可以如法炮制。这里需要特别说明一点:由于移动设备、嵌入式系统或边缘计算设备的硬件资源有限,4bit 量化在这里至关重要——它大幅降低模型大小和计算需求,让这些设备跑大模型成为可能。@adamcohenhillel 也正是用了 4bit 量化来推理 Llama 3 8B。
那么,具体怎么操作?以下就是那份在树莓派 5 上运行 Mistral 7B 的指南,直接移植给 Llama 3 8B 就可以。
首先,确保你有一台树莓派 5,至少 8GB 内存,再准备一张 32GB 的 SD 卡。接着安装操作系统:从官网下载 Raspberry Pi OS,运行后你会看到引导画面。
选择设备为 Raspberry Pi 5,选择最新系统镜像(推荐 64 位版本),存储位置选插入的 SD 卡。点击“next”,系统会问你是否编辑设置——选“编辑设置”:
完成后,把 SD 卡插入树莓派,接上电源。使用 SSH 协议远程连接并登录:
ssh
好了,环境就绪。接下来就是装大模型——作者提供了两种方法。
Ollama 是一个开源工具,提供简单的安装指令和命令行界面,能让本地跑大模型变得无比丝滑。
第一步:安装 Ollama,运行这个命令:
curl -fsSL https://ollama.com/install.sh | sh
这个命令会从 Ollama 官网下载安装脚本并执行,在树莓派上安装好 Ollama。
第二步:下载并运行 Mistral 模型。直接执行:
ollama run mistral
结束。对,就这么简单。
如果想来点更底层的操作,llama.cpp 是个好选择——它是用 C++ 编写的高效推理工具,专为在 CPU 上运行 Llama 模型而生。
第一步:安装必要的软件包。打开命令行,输入:
sudo apt update && sudo apt install git g++ wget build-essential
第二步:下载 llama.cpp 代码库:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
第三步:编译 llama.cpp:
make -j
这步让 make 工具自动把源代码转换为可执行程序。
第四步:找到并下载 Mistral 7B 模型。先进入模型目录:
cd models
wget https://huggingface.co/TheBloke/Mistral-7B-v0.1-GGUF/resolve/main/mistral-7b-v0.1.Q4_K_S.gguf
第五步:回到代码库根目录,运行模型。用这个命令让它回答“What’s up?”:
cd ..
./main -m models/mistral-7b-v0.1.Q4_K_S.gguf -p "Whatsup?" -n 400 -e
搞定,结束。
简单总结一下:这两种方法都可以在树莓派 5 上跑起来,区别在于 Ollama 最省事,llama.cpp 则让你对推理过程有更多控制。把模型换成 Llama 3 8B 的 4bit 量化版,同样的步骤就能在不到 100 美元的设备上跑出那个让人惊叹的效果。而这,大概就是开源世界最迷人的地方——没有上限,只有想不到。
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
Ondo将于今日上线股票永续合约
暗黑4S14野蛮人终局BD攻略
区块链OTC交易所有哪几家比较正规?
Binance新增15种bStocks代币化证券为杠杆抵押资产
Meme币DOGS今晚上线!开局就解锁91%代币是否带来风险?
忍者必须死3极刃血影角色介绍
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
余姚的路虎4s店在哪个位置
彩云天气怎么看分钟级降雨预报 彩云天气精准预报方法【技巧】
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
华为Mate 70系列首发的红枫镜头下放至千元档:全员普及原色影像
合集38个项目筹集5.406亿美元 Figure融资2亿
国家养老服务消费补贴上线京东
英伟达机器人团队在京沪深招人,聚焦具身智能等四大领域
一站式PDF转Markdown解决方案PDF3MD
硬刚苹果!华为9月新品阵容出炉:Mate 90系列、全新三折叠
微软Copilot AI漏洞可致敏感数据泄露,企业用户需及时更新
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc