We’re open-sourcing lithos-metal 🚀
Megakernels + DSpark speculative decoding run Qwen3.8-27B at 200+ tokens/s/user peak on one @Apple M5 Max.
Ultra-fast inference on your laptop. Try it with any coding agent in one command.
Code: https://github.com/lithos-ai/lithos-metal
Tech blog: https://www.lithosai.com/blog/lithos-metal
