BeefAndPoultry@lemmus.org to LocalLLaMA@sh.itjust.worksEnglish · edit-23 days agollama.cpp in progress pull request for smart caching of MoE experts, 16% to 35% TPS boost for my RTX 2080plus-squaregithub.comexternal-linkmessage-square1fedilinkarrow-up15arrow-down10
arrow-up15arrow-down1external-linkllama.cpp in progress pull request for smart caching of MoE experts, 16% to 35% TPS boost for my RTX 2080plus-squaregithub.comBeefAndPoultry@lemmus.org to LocalLLaMA@sh.itjust.worksEnglish · edit-23 days agomessage-square1fedilink
minus-squareBeefAndPoultry@lemmus.orgOPtoLocalLLaMA@sh.itjust.works•Qwen 3.8 Max (2.4T-a95b) and 27B open weights being released next weeklinkfedilinkEnglisharrow-up1·5 days agoGemma is probably good for that, as long as it’s consistently succeeding at the tool calls. linkfedilink
BeefAndPoultry@lemmus.org to LocalLLaMA@sh.itjust.worksEnglish · edit-26 days agoQwen 3.8 Max (2.4T-a95b) and 27B open weights being released next weekplus-squarelemmus.orgimagemessage-square12fedilinkarrow-up13arrow-down10
arrow-up13arrow-down1imageQwen 3.8 Max (2.4T-a95b) and 27B open weights being released next weekplus-squarelemmus.orgBeefAndPoultry@lemmus.org to LocalLLaMA@sh.itjust.worksEnglish · edit-26 days agomessage-square12fedilink
Gemma is probably good for that, as long as it’s consistently succeeding at the tool calls.