[ad_1]
Команда стартапа Mostik представила метод, который позволяет ИИ-моделям обмениваться внутренними состояниями без генерации промежуточного текста.
Традиционно при совместной работе нескольких нейросетей промежуточным звеном служит сгенерированный текст. В Mostik отказались от этого этапа: вместо текста используется отдельный адаптируемый модуль («мост»), преобразующий внутреннее представление одной модели в форму, понятную для другой.
Параметры самих моделей при таком взаимодействии не корректируются.
По оценке разработчиков, перед созданием одного токена LLM формирует более сотни скрытых векторов — около миллиона числовых значений, или примерно 2 МБ внутреннего состояния. В текстовый ответ попадает лишь малая часть этой информации. Новый канал предназначен для передачи именно таких промежуточных представлений.
Для демонстрации метода команда связала GLM-5.2 от Z.ai на 753 млрд параметров и Qwen-3.5 от Alibaba — на 4 млрд.
Большая модель только обрабатывала запрос и не генерировала ответ. После этого ее внутреннее состояние передавалось через «мост», а итоговый текст формировала Qwen-3.5.
По данным Mostik, такая связка закрыла около половины разрыва в качестве между малой и большой моделями. При сравнении с обычной передачей текста преимущество нового метода достигало 10 процентных пунктов при одинаковом объеме вычислений.
Разработчики также сравнили гибридную систему с моделью среднего размера, показавшей сопоставимый результат. По их расчетам, связка GLM-5.2 и Qwen-3.5 потребовала примерно в 2,5 раза меньше вычислений.
Главный научный сотрудник Mostik Станислав Смирнов отметил, что внутренние представления разных нейросетей нельзя напрямую сопоставить друг с другом. Даже если две модели решают одну и ту же задачу, они могут по-разному кодировать полученную информацию внутри своих скрытых состояний.
По словам Смирнова, изучение таких соответствий может помочь лучше понять, как разные ИИ-системы представляют информацию и приходят к решениям. В перспективе математический анализ внутренних состояний также может показать, существуют ли общие закономерности в рассуждениях разных моделей.
[ad_2]
Источник