Сэкономить на токенах в 10 раз

Сэкономить на токенах в 10 раз

В наивной реализации нейросеть читает чат каждый раз заново и прогоняет через видеокарту всю историю диалога – хотя от запроса к запросу старые реплики не менялись. Для оптимизации провайдеры придумали кэширование – оно позволяет посчитать этот кусок однажды и дальше подставлять готовым. У Anthropic, например, чтение из кэша стоит раз в десять дешевле обычного, плюс ответ приходит быстрее.

К сожалению, лекарство неполное. Кэш живёт в памяти видеокарты, а её мало и она дорогая, поэтому под нагрузкой старые куски вытесняются и всё опять считается заново. Есть и привязка ко времени – отошёл человек от чата на час, вернулся, а контекст уже протух. В итоге глобально проблема никуда не делась – её просто немного сгладили.

Идея #стартапдня Tensormesh – не выбрасывать посчитанное, когда в видеопамяти кончается место, а сгружать кэш ниже: в обычную оперативную память, на SSD, в сетевое хранилище. Заодно он становится общим для всех видеокарт разом. Готовый кусок тогда переживает и вытеснение, и паузу, и переезд на другой сервер, а пересчитывать приходится заметно реже.

Движок можно скачать и использовать бесплатно. Он относительно популярен, на Github у проекта 9 600 звезд. У Nginx для сравнения 31 000, у OpenClaw 380 000. Зарабатывает Tensormesh на собственном хостинге чужих opensource моделей. Его формула – “кэшированные токены отдаем бесплатно”. Утверждается, что в каких-то сценариях это выйдет и в 10 раз дешевле обычной цены.

https://www.tensormesh.ai/

#ai #технология #rounda #сша
Стартап дня. Александр Горный.
Стартап дня. Александр Горный.

775 публикаций на visbl.me

Авторский канал о стартапах и интернет-бизнесе. Реклама на этом канале: https://docs.google.com/presentation/d/1BFSEj7FEQZpB4K83iBXo1yqIoPnwJaVGpsyKDHKSX0s/edit РКН: https://clck.ru/3FPm3j Личный аккаунт: @gornal Реклама: @Vzuhcha ВП нет

💬Discussion (7)

Artur Tuzbekov@turchan
Типа CDN для нейросетей 🙂
Глеб@foxruso
идея норм, но какие блин видеокарты
anthropic claude гоняет в основном на trainium и tpu (один project rainier это больше ляма чипов trainium2) плюс часть на nvidia это не видюхи а спец ускорители.
у датацентровых даже видеовыхода нет
сам кэш из памяти ускорителя выгружать тут все ок но про железо перепутаны термины
Герман Тебиев@terbiy
Забавно, конечно, что базовый механизм работы компьютеров можно завернуть в стартап. Это примерно также забавно, как и то, что нейросети, хотя и дитя компьютера, разучились считать.😅
AI-клубы нейроприватки@m_yousuf55
Интересный подход с кэшированием! 🔍 Это действительно помогает снизить затраты и ускорить процесс. Но, как вы отметили, проблема с ограниченной памятью видеокарты и истечением времени контекста остаётся актуальной. Интересно, как Tensormesh планирует решить эти вопросы и какие у них есть идеи для дальнейшего оптимизации! 💡
Алексей Кизилов@flamespirit83
когда же такое умрет то.....
Valentin@apovalov
На длинных агентных сессиях кэш Anthropic экономит ощутимо, но как раз ловил его обнуление при паузах и под нагрузкой. Из-за привязки ко времени приходилось пинговать контекст, чтобы не пересчитывать всё заново. Идея сгружать кэш на уровень ниже бьёт ровно по этой боли.
Join discussion on TelegramComments are synced from Telegram

Связанные темы

Читать далее