AMD is combining its Instinct GPUs with Cerebras Systems' SRAM-powered AI accelerators to deliver ultra-low-latency inference for agentic workloads, aiming for up to 5x tokens per second per watt improvement. This collaboration addresses a gap in AMD's portfolio, similar to NVIDIA's acquisition of Groq for its Language Processing Units.