Backburnerは、GitHubユーザーStayLameBroが10月1日に公開したMITライセンスのオープンソースプロジェクトで、llama.cppのフォークとiPhone側のコンパニオンアプリで構成される。Apple Silicon MacとiPhone 15 Pro以降(M系iPadは未検証)を10Gbps対応のUSB-Cケーブルでつなぐと、Qwen3.8-27Bの64層のうち1〜40層をMac、41〜64層をiPhoneのGPUが担当し、256トークン単位のマイクロバッチごとにパイプライン処理する。作者が24GBのM4 Pro MacBookとiPhone 17 Pro Maxで測った結果では、16k〜48kトークンの文脈でprefillが29〜44%高速化した。生成速度はほぼ変わらず、出力はiPhoneの有無でトークン単位で同一になるという。Mac単体では8bitのKVキャッシュで約64kトークンが上限だが、iPhone側に古い文脈を持たせることで8bitで128kトークンまでの動作を確認している。一度に1リクエストしか扱えない、約512トークン未満の短い入力では効果がないなど、プレリリース段階の制約も明記されている。数値は作者自身の計測で第三者の検証はまだないが、ベンチマーク用スクリプトも公開されている。
iPhoneをMacのLLM推論に加勢させるBackburner、長文の読み込みを最大44%高速化
## POINTS
- MacとiPhoneをUSB-Cで接続し、モデルの層を分割してiPhoneのGPUでも処理するllama.cppフォーク
- Qwen3.8-27Bで16k〜48k文脈のprefillが29〜44%高速化、出力はトークン単位で同一
- 24GB Macで8bit文脈を約64kから128kまで拡張、ただし1リクエストずつなどプレリリースの制約あり