CPU-first long-context KV memory optimization with deterministic page regeneration and exact folded attention.
rust machine-learning cpu deep-learning optimization transformers inference attention attention-mechanism rope memory-optimization gqa alibi kv-cache llm long-context mqa-internal
-
Updated
Jul 9, 2026 - Rust