论文 信源:X:Rohan Paul (@rohanpaul_ai) · 👁️ 29332 次研读

FreeToken 引擎让 8GB 游戏本跑 35B 模型

💡 灵机 AI 深度洞见与核心提炼
伯克利和得克萨斯大学推出 FreeToken,新引擎可在普通设备上运行大型开源模型。8GB 游戏本跑 35B 模型达 39.3 tokens/秒,快于生产环境中的 Codex。FreeToken 让 GPU 缓存跟随路由请求,将专家缺失率从 llama.cpp 的 62% 降至 16%,其余按 PCIe 和内存速度比例分配。
信源媒体:X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗
阅读原文出处 ↗