ПОСЛЕДНИЕ НОВОСТИ
ПОДОБРАНО ДЛЯ ВАС

DeepSeek представляет mHC, но сталкивается с препятствиями при рецензировании

АвторЭнаси МапакамеЭнаси Мапакаме 3 мин. чтения
DeepSeek представляет mHC, но сталкивается с трудностями при прохождении рецензирования.
  • DeepSeek предлагает новый подход к масштабированию ИИ без увеличения вычислительных мощностей.
  • Исследователи видят потенциал, но предупреждают, что необходимы дополнительные испытания.
  • mHC может изменить подход к обучению больших языковых моделей.

В то время как существуют проблемы с растущими затратами на разработку и поддержку ИИ и ограниченным количеством доступного оборудования, DeepSeek представила новый план разработки и масштабирования искусственного интеллекта (ИИ).

Китайский стартап считает, что может создавать значительно лучшие модели ИИ, не обязательно добавляя больше чипов и, следовательно, увеличивая потребление энергии. Хотя предложенная концепция mHC привлекла значительное внимание многих исследователей этой темы, она в целом считается все еще находящейся на ранних стадиях.

Потребуется дальнейшее исследование, чтобы определить преимущества подхода при разработке более крупных систем ИИ. Технический документ, детализирующий концепцию mHC, был выпущен на прошлой неделе и соавтором которого является Лиан Вэньфэн, основатель и генеральный директор DeepSeek.

DeepSeek пересматривает дизайн сети для масштабирования ИИ

Одним из основных компонентов работы является переоценка того, как информация передается между различными слоями многослойной нейронной сети.

Каждый слой в нейронной сети передает следующему слою в модели форму обработанной информации, создавая то, что было названо «Сетью остаточного обучения» (ResNet). Разработанная исследователями Microsoft Research Каймином Хе и другими примерно десять лет назад, ResNet обеспечила фундаментальную основу для многих из самых современных систем ИИ сегодня.

Концепция, разработанная DeepSeek, была создана после того, как ByteDance представила Hyper-Connections в 2024 году. Hyper-Connections позволяют информации проходить по нескольким маршрутам через сеть, а не только по одному основному пути, что может увеличить скорость обучения и богатство опыта.

Однако, хотя они могут быть полезны, они также могут приводить к проблемным ситуациям при обучении, когда модели испытывают нестабильность обучения или полный сбой.

Согласно Сун Линци (Городской университет Гонконга), исследования DeepSeek являются продолжением существующей идеи, продолжением того, как DeepSeek смотрит на работу других компаний, а не изобретением чего-то с нуля.

ResNet сравнивается с однополой скоростной автомагистралью, в то время как Hyper-Connections напоминают многополосную скоростную автомагистраль; однако Сун предостерег, что наличие нескольких полос без надлежащих правил может привести к большему количеству столкновений.

Профессор Го Сун из Гонконгского университета науки и технологий считает, что этот исследовательский документ может указывать на изменение поведения в исследованиях ИИ. Вместо того чтобы продолжать вносить небольшие изменения в конструкции существующих моделей, он считает, что исследования могут эволюционировать в сторону разработки новых моделей на основе теоретических конструкций.

Исследователи тестируют mHC, но вызывают практические опасения

Несмотря на возбуждение по поводу недавнего достижения в тестировании mHC для глубокого обучения, эксперты подчеркнули, что исследования все еще не завершены. Тестирование, предоставленное DeepSeek, использовало только четыре пути данных при тестировании моделей с 27 миллиардами параметров.

«Эксперименты подтвердили модели до 27 миллиардов параметров, но как она будет работать с современными передовыми моделями, которые на порядок больше?»

Профессор Го Сун.

ИИ-модели, доступные сегодня, больше и обычно имеют сотни миллиардов параметров по сравнению с 30 миллиардами параметров, которые были стандартом всего несколько лет назад.

Го поддержал эти мнения и заявил, что пока никто не может сделать вывод, сможет ли mHC выполнять работу на переднем крае технологий ИИ. Он также заявил, что инфраструктура, необходимая для функционирования mHC, может быть слишком продвинутой для использования небольшими исследовательскими институтами и компаниями на мобильных устройствах.

Согласно Cryptopolitan, популярность DeepSeek пришла благодаря выпуску большой языковой модели DeepSeek V3, а последующий выпуск их модели рассуждений DeepSeek-R1 произошел всего через несколько недель.

При сравнении результатов моделей с их конкурентами во время тестовых испытаний обе модели смогли достичь или превзойти результаты конкурентов, несмотря на то, что были выпущены с использованием лишь доли обучающих данных, использованных для других конкурирующих языковых моделей.

Не просто читайте новости о криптовалютах. Понимайте их. Подпишитесь на нашу рассылку. Это бесплатно.

Поделиться статьёй
Энаси Мапакаме

Энаси Мапакаме

Энаси Мапакаме — журналист с более чем 10-летним опытом работы в сфере деловых и финансовых новостей. Она освещает вопросы капитальных рынков и emerging technologies: метавселенную, искусственный интеллект и криптовалюту. Энаси имеет степень бакалавра соhonours по специальности «Медиа и исследования общества».

ЕЩЁ … НОВОСТИ