GLM-5.3-Flash (ox-alpha) as Cogni-Brain on single NVIDIA DGX Spark (GB10): llama.cpp SM 121a, 18.7 tok/s decode, 32K context, 100/100 tool-eval
mtp reasoning unified-memory llama-cpp local-llm local-ai gguf speculative-decoding unsloth agentic-ai tool-calling gb10 dgx-spark grace-blackwell sm121 cogni-brain ox-alpha glm-5-3-flash spark-brain glm-53-flash
-
Updated
Sep 10, 2026 - Shell