llama.cpp releases · · 1 min read

b10635

Mirrored from llama.cpp releases for archival readability. Support the source by reading on the original site.

cuda: unblock mmq for MoE on sm_60 (#26264)

  • cuda: unblock mmq for MoE on sm_60

  • cuda: duplicate mmq-config-pascal for dp4a and older

  • cuda: reduce occupancy on non-dp4a pascal for Q2_K, Q4_K, Q5_K, Q6_K

Website:

Attestations:

macOS/iOS:

Linux:

Android:

Windows:

openEuler:

  • DISABLED
  • openEuler x86 (310p)
  • openEuler x86 (910b, ACL Graph)
  • openEuler aarch64 (310p)
  • openEuler aarch64 (910b, ACL Graph)

Discussion (0)

Sign in to join the discussion. Free account, 30 seconds — email code or GitHub.

Sign in →

No comments yet. Sign in and be the first to say something.

More from llama.cpp releases