Reflection AIのBeamが早期アクセスを開始、オープンウェightsは10月下旬に公開予定

- Reflection AIは10月5日、5,010億パラメータのオープンウェイトモデル「Beam」の早期アクセスを開放した。
- ウェイト、技術レポート、モデルカードは、Apache 2.0ライセンスの下で10月下旬に公開される。
- Reflectionによると、Beamは推論計算量を3〜4分の1に抑えながら、Z.aiのGLM-5.2と同等の推論テスト結果を示している。
Reflection AIは10月5日、初のオープンウェイトモデル「Beam」を早期アクセスでリリースした。 モデルはレッドチームング(脆弱性評価)を終了段階にあり、ウェイト、技術レポート、モデルカードは今月中に公開される予定だ。
Reflectionによれば、ウェイトはApache 2.0ライセンスの下で提供され、Beamの実行・評価・ファインチューニングのためのフルスタックも含まれる。
GLM-5.2並みの性能を発揮しつつ、推論計算量は3〜4分の1で済む
Beamは、5,010億パラメータとトークンあたり230億のアクティブパラメータを持つスパースMixture-of-Expertsモデルです。23.8兆トークンで事前学習され、中間トレーニング段階でコンテキスト長が100万トークンに達しました。
Reflectionによると、Beamは高度な推論テストでZ.aiのGLM-5.2と同等のパフォーマンスを示しつつ、「推論計算量が3〜4倍少ない」と主張しています。この主張は独立して検証されていません。
GLM-5.2は約7,440億パラメータ、400億のアクティブパラメータを持ちます。ReflectionはKimi K3を純粋な能力面で上回ると位置づけ、Beamの優位性は推論効率にあると強調しています。
7月にリリースされたThinking Machines LabのInklingとの比較において、Reflectionの表ではBeamが4つのコーディングベンチマークで両モデルを上回るスコアを示しています。
SWE Bench Pro v2-Hardでは、Beamは77.2点、Inklingは56.9点を記録しました。Inklingはマルチモーダルである一方、Beamはテキストのみに対応しています。

10,500 Nvidia GB300 GPUが4週間の強化学習で使用されました
Reflectionの強化学習ランは、10,500台のNvidia GB300 GPUを4週間使用し、1億回以上のロールアウトを生成し、トレーニングと採点のために約13億のサンドボックスを利用しました。
同社によれば、これはオープンラボが行った最大の強化学習ランの一つです。Reflectionの集計では、Inklingは3,000万回のロールアウトで学習を行いました。
Reflectionは2024年に、元Google DeepMind研究者であるMisha Laskin氏とIoannis Antonoglou氏によって設立されました。Nvidia、Sequoia Capital、Lightspeed Venture Partnersなどの投資家から約47億ドルの資金調達を果たし、直近では企業価値250億ドル(プレマネー)で評価されています。
1年前、同社は80億ドルの評価額で20億ドルを調達し、Cryptopolitanが報じた。SpaceXとの取引だけでも、メンフィスの近くにあるColossus 2でのNvidia GB300容量に対して月額1億5,000万ドルで最大63億ドルに上り、これは6月にCryptopolitanが伝えたもの。
Beamはまた、Reflectionの「AIファクトリー」提案にも力を与えています。これにより、機関は独自のデータでモデルをトレーニングし、自前の計算資源で実行できます。新世グループは韓国で主権版を試験運用しています。
「彼らはまるでロケットシップのようなものです」と、ラスキンはモデルがフロンティアに至る過程について述べています。「大きなロケットシップを作るには時間がかかります。」
これをお読みいただいているあなたは、すでに一歩先を行っています。当社のニュースレターでその先を行ってください。
よくある質問
Beamとは何ですか?誰が構築しましたか?
BeamはReflection AI初のオープンウェイトモデルであり、5010億パラメータのMixture-of-Expertsシステムです。
Beamの重みはいつリリースされますか?
最終的なレッドチームテスト終了後、2026年10月下旬にApache 2.0ライセンスの下で公開されます。
Beamは競合モデルと比べてどうですか?
Reflectionによると、Beamは推論計算量を3〜4倍削減しながらも、Z.aiのGLM-5.2と同様の推論テスト結果を達成しています。

ランダ・モーゼス
ランダ・モーゼスはCryptopolitanのエディター兼記者で、テクノロジー、AI、ロボティクス、暗号資産、詐欺、ハッキングなどを担当しています。2017年以来暗号資産分野で活動しており、Forward Protocol、AmaZix、Cryptosomniacで役職を務めました。ブラッドフォード大学で電気電子工学の学位を取得しています。
















