DiffusionGemma не пишет слово за словом — она выдаёт сразу блоками по 256 токенов. Скорость: до 1000 токенов в секунду. Это в 4 раза быстрее обычных LLM.
Весит 26B параметров, но активирует только 3.8B — влезает в 18 ГБ видеопамяти. Качество пока ниже Gemma 4, поэтому Google позиционирует её для исследований и кодинга.
Открытая, бесплатная, Apache 2.0 на Hugging Face.
Почему важно: если этот подход доведут до ума — все LLM станут в разы быстрее. Не эволюция — революция в архитектуре.
Скорость или качество?
🔥 — скорость, 1000 токенов/с это мощь ❤️🔥 — качество важнее 🤝 — жду когда совместят оба
Поделитесь в комментариях
⚡️ Готовим ИИшницу 📲 AI новости без шума в тг боте 📰 Еще больше новостей тут
Оригинал: пост в Telegram · подписаться на «Готовим ИИшницу»