Малые языковые модели (SLM) считаются следующим большим прорывом в ИИ

- Хотя большие языковые модели (LLM) критически важны для бизнеса, позволяя решать множество различных задач, эксперты считают перспективы малых языковых моделей (SLM) очень светлыми.
- В отличие от LLM, SLM более энергоэффективны и обладают рядом других преимуществ, что делает их идеальным выбором
- Однако крупные технологические компании инвестируют огромные средства в разработку больших языковых моделей (LLM).
В то время как компании вкладывают деньги в большие языковые модели (LLM), некоторые эксперты в области ИИ считают, что малые языковые модели (SLM) станут следующим большим прорывом.
Это происходит на фоне роста активности в отрасли с наступлением праздничного сезона, когда технологические компании инвестируют больше средств в развитие своих технологий.
Будущее за малыми языковыми моделями
Такие компании, как xAI, управляемая миллиардером Илоном Маском, смогли привлечь дополнительные 5 млрд долларов от Andreessen Horowitz, Qatar Investment Authority, Sequoia и Valor Equity Partners, в то время как Amazon инвестировала дополнительные 4 млрд долларов в Anthropic, конкурента OpenAI.
В то время как крупные технологические компании и другие вкладывают миллиарды долларов в разработку больших LLM для выполнения множества различных задач, реальность ИИ такова, что не существует универсального решения, так как бизнесу нужны модели, специфичные для конкретных задач.
Согласно заявлению главного исполнительного директора AWS Мэтта Гармана об их расширяющемся партнерстве и инвестициях, уже есть подавляющий отклик от клиентов AWS, которые разрабатывают генеративный ИИ на базе Anthropic.
Для большинства компаний LLM по-прежнему являются выбором номер один для определенных проектов, но для других этот выбор может быть дорогим с точки зрения затрат, энергии и вычислительных ресурсов.
Стивен Макмиллан, президент и генеральный директор Teradata, который предложил альтернативный путь для некоторых компаний, также имеет другие взгляды. Он уверен, что будущее за SLM.
«Глядя в будущее, мы считаем, что малые и средние языковые модели, а также контролируемые среды, такие как доменно-специфичные LLM, обеспечат гораздо лучшие решения».
~ Макмиллан
SLM производят настраиваемые результаты для конкретных типов данных, поскольку языковые модели специально обучены для этого. Поскольку данные, генерируемые SLM, хранятся внутри компании, языковые модели обучаются на потенциально конфиденциальных данных.
Поскольку LLM потребляют много энергии, малые языковые версии обучаются масштабировать как вычислительные мощности, так и использование энергии в соответствии с реальными потребностями проекта. Такие корректировки означают, что SLM эффективны при более низкой стоимости по сравнению с текущими большими моделями.
Для пользователей, которые хотят использовать ИИ для получения специфических знаний, существует вариант доменно-специфичных LLM, так как они не предлагают широких знаний. Они обучены глубоко понимать только одну категорию информации и отвечать более точно, например, в домене CMO или CFO.
Почему SLM являются предпочтительным вариантом
Согласно Ассоциации ученых по данным (ADaSci), полное развитие SLM с 7 миллиардами параметров для миллиона пользователей потребует всего 55,1 МВт·ч (мегаватт-часов).
ADaSci выяснил, что обучение GPT-3 с 175 миллиардами параметров потребовало примерно 1 287 МВт·ч электроэнергии, и эта цифра не включает потребление энергии в период официального использования публикой. Таким образом, SLM использует примерно 5% энергии, потребляемой при обучении LLM.
Большие модели обычно запускаются на облачных компьютерах, поскольку они используют больше вычислительной мощности, чем доступно на индивидуальном устройстве. Это приводит к осложнениям для компаний, так как они теряют контроль над своей информацией при ее перемещении в облако, а также к медленным ответам из-за передачи данных через интернет.
В будущем внедрение ИИ бизнесом не будет универсальным, так как в центре внимания будут эффективность и выбор лучшего и наименее дорогого инструмента для выполнения задач, что означает выбор модели правильного размера для каждого проекта.
Это будет сделано для всех моделей, будь то LLM общего назначения или более мелкие и доменно-специфичные LLM, в зависимости от того, какая модель даст лучшие результаты, потребует меньше ресурсов и снизит необходимость миграции данных в облако.
На следующем этапе ИИ будет жизненно важен для бизнес-решений, поскольку общественность имеет высокий уровень доверия к ответам, сгенерированным ИИ.
«Когда вы думаете об обучении моделей ИИ, они должны быть построены на основе отличных данных».
~ Макмиллан
«В этом и заключается наша суть: предоставление надежного набора данных, а затем предоставление возможностей и аналитических функций, чтобы клиенты и их клиенты могли доверять результатам», — добавил Макмиллан.
В мире, где востребованы эффективность и точность, меньшие и доменно-специфичные LLM предлагают еще один вариант получения результатов, на которые могут положиться компании и более широкая общественность.
Самые умные крипто-энтузиасты уже читают нашу рассылку. Хотите присоединиться? Присоединяйтесь.
Отказ от ответственности. Предоставленная информация не является торговой рекомендацией. Cryptopolitan.com Мы не несем ответственности за любые инвестиции, сделанные на основе информации, представленной на этой странице. Мы настоятельно рекомендуем проводить независимое исследование и/или проконсультироваться с квалифицированным специалистом перед принятием любых инвестиционных решений.
Энаси Мапакаме
Энаси Мапакаме — журналист с более чем 10-летним опытом работы в сфере деловых и финансовых новостей. Она освещает вопросы капитальных рынков и emerging technologies: метавселенную, искусственный интеллект и криптовалюту. Энаси имеет степень бакалавра соhonours по специальности «Медиа и исследования общества».















