backburner
★ 451A llama.cpp-based local inference engine that splits Qwen3.8-27B workloads between an Apple Silicon Mac and a connected iPhone. It uses the phone for prompt processing and long-context attention, and exposes an OpenAI-compatible server.
AI Frameworks | Python · local LLM inference · llama.cpp
View Project →