ELYZA-Thinking-1.0-llm-jp-4 が Apache 2.0 で無料公開されました
KDDI 傘下の AI 開発企業である ELYZA 株式会社は、2026 年 10 月 2 日、新しい 2 つの AI モデル「ELYZA-Thinking-1.0-llm-jp-4-33b」と「ELYZA-Thinking-1.0-llm-jp-4-32b-a3b」を無料公開しました。いずれも Apache 2.0 ライセンスで、ELYZA の公式発表 によると、商用利用を含めて利用できる条件で Hugging Face 上に重みが公開されています。
この 2 モデルは、ELYZA が一から事前学習したものではありません。ベースモデルは、国立情報学研究所 (NII) が開発した「LLM-jp-4」シリーズです。ELYZA が行ったのは、数学・コーディング・STEM 領域の日本語データを使った中間学習 (mid-training) から、SFT (教師ありファインチューニング)、検証可能な問題での強化学習までの、追加の事後学習 (post-training) です。ITmedia の記事 は、公開直後は「完全国産」という表現で紹介していましたが、公開後にこの表現を訂正した経緯があります。開発体制を正確に言うなら、「NII が一から事前学習したベースモデルに、ELYZA が事後学習を重ねたモデル」です。
この記事では、公式情報だけで確認できる範囲に絞って、2 モデルの仕様とベンチマークの確定値、Apache 2.0 の実質的な自由度、自社の GPU で動かせる規模、そしてカスタマーセンター業務ベンチマークの数字をどう受け止めるべきかを整理します。オープンウェイトモデルを自社で評価する基準そのものは、オープンウェイト 3 モデル比較 で扱った考え方をそのまま踏襲します。
モデルの仕様とベンチマーク
33b は Dense (非 MoE) 構成、32b-a3b は MoE (Mixture of Experts) 構成です。中身が大きく違うので、まず仕様を並べます。
| 項目 | ELYZA-Thinking-1.0-llm-jp-4-33b | ELYZA-Thinking-1.0-llm-jp-4-32b-a3b |
|---|---|---|
| 構成 | Dense | MoE (Routed Experts 128・Activated Experts 8) |
| ベースモデル | llm-jp/llm-jp-4-33b-base | llm-jp/llm-jp-4-32b-a3b-base |
| 総パラメータ | 33B | 約 32.1B |
| アクティブパラメータ (1 トークンあたり) | 33B (全体が計算に使われる) | 約 3.8B |
| コンテキスト長 | 65,536 トークン | 65,536 トークン |
| 推奨サンプリング | temperature 0.6 / top_p 0.95 | 同左 |
| 推奨実行環境 | vLLM (Transformers・SGLang にも対応) | 同左 |
| ライセンス | Apache 2.0 | Apache 2.0 |
32b-a3b のアクティブパラメータ・Routed Experts・Activated Experts の数は、ベースモデル llm-jp/llm-jp-4-32b-a3b-base の Hugging Face モデルカードで確認できる値です。ELYZA が行ったのは事後学習のみで、アーキテクチャ (総パラメータ・アクティブパラメータ・Experts の構成) はベースモデルから変わっていないと考えられるため、この値をそのまま採用しています。
次に、公式モデルカード が示すベンチマークの確定値を並べます。
| ベンチマーク | -33b (Dense) | -32b-a3b (MoE) |
|---|---|---|
| MMLU-Pro (英) | 77.53 | 記載なし |
| JMMLU (日) | 84.69 | 81.05 |
| MATH-500 (英) | 96.00 | 95.20 |
| JMATH-500 (日) | 90.00 | 記載なし |
| IFEval (英) | 記載なし | 93.70 |
| M-IFEval-ja (日) | 記載なし | 81.75 |
| JHumanEval (日) | 記載なし | 95.37 |
| 総合平均 | 61.69 | 58.46 |
上表は公式モデルカードに掲載されている指標の一部です。「総合平均」はモデルカードが独自に算出した集計値で、上表に抜粋した指標だけの平均ではありません。
注意
32b-a3b の「総合平均」は 58.46 です。Hugging Face のモデルカード には、これとは別に日本語平均 59.61・英語平均 55.94 という言語別の平均も並んでおり、数字の見た目が近いために混同しやすくなっています。総合平均と言語別平均は別の数字です。
報道のうち ビジネス+IT は、33b を 61.7、32b-a3b を 58.5 と紹介しています。小数第 1 位で丸められていますが、これは総合平均 (61.69・58.46) に近い値です。報道で紹介されているのは総合平均のほうで、日本語平均・英語平均ではないと分かります。
FIXIT58.46 と 59.61 って、どっちが「本当のスコア」なの?
Hayate58.46 が総合平均です。59.61 と 55.94 は日本語と英語で分けた平均ですね。
FIXITじゃあ、報道で見た 58.5 っていうのは?
Hayate総合平均を丸めた数字です。社内で共有するなら、どちらの平均かを必ず書いてください。
ELYZA の公式発表 と ITmedia の記事 は、20 種類のベンチマークの総合スコアで、国立情報学研究所が 2026 年 9 月 28 日に発表した「LLM-jp-4.1」シリーズを一部で上回ったと説明しています。ただし、どの指標で何点上回ったかという具体的な比較数値は、PR TIMES 本文・ITmedia 記事・Hugging Face の各モデルカードのいずれにも記載がありません。上回ったという説明自体は公式発表によるものですが、数値での検証はできない状態だと理解しておく必要があります。
ライセンスはどこまで自由か
どちらのモデルも Apache 2.0 ライセンスです。Hugging Face の各モデルカード に明記されています。Apache 2.0 は商用利用・改変・再配布を広く認めるライセンスですが、何でも無条件に自由というわけではありません。
Apache 2.0 の主な条件は次のとおりです。著作権表示とライセンス全文を配布物に残す必要があり、ファイルを変更した場合はその旨を明示します。あわせて、コントリビューターからの特許訴訟を防ぐ明示的な特許許諾条項が入っています。一方、GPL 系のライセンスのように、派生物を同じライセンスで公開する義務はありません。
既存記事で扱ったモデルと並べると、ライセンスの立ち位置が見えます。
| モデル | ライセンス | 重みの公開 | 商用利用 |
|---|---|---|---|
| ELYZA-Thinking (33b・32b-a3b) | Apache 2.0 | 公開済み | 可 |
| Gemma 4 12B | Apache 2.0 | 公開済み | 可 |
| Kimi K3 | Modified MIT | 公開予定として発表 | 条件あり、原文の確認が必要 |
| Qwen3.8-Max | 記載なし (非公開) | 未公開 | API 経由の商用利用のみ |
Kimi K3 の Modified MIT は、名前だけ見ると MIT の緩さを想像しますが、追加された条件は個別に確認しないと分かりません。Apache 2.0 は条文が公開されており、追加条件が無い標準的な内容です。名前が緩そうに見えるライセンスでも、中身は様々だと分かります。Qwen3.8-Max は、この記事を執筆した時点でオープンウェイトが公開されていません。API 経由で使う商用モデルという位置づけで、ライセンス名も公開されていないため、ここでは条件を比較できません。
自社の GPU・クラウドで動かせるか
重みが公開されていても、自社の環境で動かせるかどうかは別の話です。オープンウェイト 3 モデル比較 で使った見積もり方 (bf16 はパラメータ数 × 2 バイトが下限) を、ELYZA-Thinking の 2 モデルにも当てはめます。
| モデル | bf16 (重みの保存) | FP8 (約 1/2) | 4 ビット (約 1/4) |
|---|---|---|---|
| -33b (Dense、33B) | 約 66GB | 約 33GB | 約 17GB |
| -32b-a3b (MoE、総パラメータ約 32.1B) | 約 64GB | 約 32GB | 約 16GB |
ここで注意が必要なのは、32b-a3b の数字が「重みを保存するための容量」だという点です。MoE 構成は、128 個のエキスパートのうちトークンごとに 8 個だけが発火する仕組みで、保存するのは 128 個すべての重みですが、1 回の推論で実際に計算が走るのはアクティブパラメータの約 3.8B 分だけです。つまり、保存する容量は 33b とほぼ同じでも、推論にかかる計算量は 33b よりずっと軽いという違いがあります。
4 ビット量子化まで落とせば、どちらのモデルも 17GB 前後に収まります。前述の記事で基準にした「24GB のコンシューマ GPU 1 枚に載るか」で見ると、ELYZA-Thinking の 2 モデルはどちらも載る側です。同じ記事で紹介した DeepSeek-V4-Pro (1.7 兆パラメータ、bf16 で約 3.4TB) や、Kimi K3 (2.8 兆パラメータ、bf16 で約 5.6TB) は、データセンター級の構成が前提でした。規模の違いで言えば、ELYZA-Thinking の 2 モデルは、むしろ Gemma 4 12B や Muse Glimmer 30B に近い、手元の GPU で検討できる部類に入ります。
もう 1 点、重要な違いがあります。ELYZA-Thinking の 2 モデルには、ELYZA 自身による API 提供の記載が Hugging Face のどちらのモデルカードにもありません。重み配布のみで、アプリや Web 版からすぐ試す経路は用意されていません。性能を確かめるだけでも、自社かクラウドでホストする作業が先に必要になります。
コツ
まず試すだけなら、4 ビット量子化版を vLLM で起動し、公式モデルカードの推奨値 (temperature 0.6 / top_p 0.95) に合わせて小さいタスクで挙動を確かめるのが手堅い進め方です。コンテキスト長をフルの 65,536 トークンで使うと KV キャッシュの分だけメモリが上乗せされるため、実際に使う長さに合わせて絞ると安定します。
国産モデルという位置づけと、業務利用前に確認すること
ELYZA-Thinking は、KDDI 傘下の日本企業が、国立情報学研究所という公的機関が開発したベースモデルに事後学習を行ったモデルです。この開発体制は、社内説明のしやすさにつながる面があります。一方で、「国産だから安全」と無条件に判断するのは早計です。
まず、ELYZA 自身による API 提供は無く、重み配布のみです。業務で使うなら自社かクラウド上でホストする構成が前提になり、外部との通信を絞る設計や、アクセス権限の管理は、提供元ではなく利用する側の責任になります。「国産だから安心」という評価はモデルの出自についての話であって、自社でホストする環境の設計を省略してよいという意味ではありません。
FIXIT国産で、しかも大学系の技術がベースなら、もう安心ってことだよね?
Hayate出自の話と、セキュリティ設計の話は別です。API が無いので、閉じた環境を作るのは自分たちの仕事になります。
FIXIT国産かどうかより、どう動かすかのほうが大事なんだ。
Hayateコスパで言うと、そこを詰めてからライセンスと性能を見るのが早いです。
カスタマーセンター業務ベンチマークの数字をどう受け止めるか
ELYZA の公式発表 は、モデル公開と同じ日に、日本語のカスタマーセンター業務を対象にした AI エージェント向けベンチマーク「ELYZA Agent Tasks: Customer Service」を GitHub (elyza-inc/elyza-agent-tasks-customer-service) で公開したと説明しています。あわせて、次の数字を挙げています。
| 指標 | 結果 |
|---|---|
| 自律改善エージェント (後述の ELYZA RSI Research が開発) によるハーネス改善 (2 つのベンチマーク) | タスク成功率が 14.4 ポイント・27.2 ポイント向上 |
| 問い合わせ応答業務の完遂率 | 34.3% から 52.9% へ 18.6 ポイント向上 |
| 推論コスト | 67% 削減 |
補足
これらの数字は、ELYZA 自身が社内実験として説明している結果です。第三者による検証ではありません。「未使用テストデータでの実測」と説明されていますが、測定した主体は ELYZA 自身であり、その点を踏まえて参考情報として扱う必要があります。
自社で AI エージェントの導入や問い合わせ対応の自動化を検討している場合、この数字自体を鵜呑みにするのではなく、「どういうタスクで、どういう評価基準を置くと改善を測れるか」という設計のほうを参考にする読み方が実務的です。評価ハーネスの組み方自体は、AI エージェント開発 でもご相談いただけます。
ELYZA RSI Research という背景
ELYZA は同じ 2026 年 10 月 2 日に、「AI による AI 開発」や「再帰的自己改善 (RSI)」を研究する新しい組織「ELYZA RSI Research」の設立も発表しました。公式発表 によると、AI エージェントが基盤モデルとハーネス (エージェントの動作やツール利用を制御する仕組み) を自ら開発・改善し、評価機構で検証する仕組みを構築するのが狙いです。
ただし、現段階は RSI そのものではなく、その前段階にあたる要素研究だと明記されています。「AI だけで AI の開発を自律的にやりきっている」という理解は、現時点の発表内容からは言い過ぎです。今回公開された 2 モデルの学習・評価についても、人間が関わる工数を「1〜2 人日程度に抑えながら」実行したと ELYZA 自身が説明していますが、これも ELYZA 自身の説明であり、第三者による検証は確認できていません。
同日、研究成果を活用した「バーティカル AI 事業」の開始も発表され、第一弾として音声対話 AI エージェント「ELYZA Voice Agent」の名称が挙げられています。本記事はモデル 2 本の技術評価と商用利用の判断を主題にしているため、この事業の詳細には立ち入りません。
既存のオープンウェイト勢との位置づけ・使い始め方
規模・ライセンス・開発主体の 3 つの観点で、既存の記事で扱ったオープンウェイトモデルと並べます。
| モデル | 総パラメータ | ライセンス | 開発主体 |
|---|---|---|---|
| ELYZA-Thinking の -33b | 33B (Dense) | Apache 2.0 | KDDI 傘下 ELYZA (NII のベースモデル) |
| ELYZA-Thinking の -32b-a3b | 約 32.1B (MoE、アクティブ約 3.8B) | Apache 2.0 | 同上 |
| Gemma 4 12B | 約 12B (Dense) | Apache 2.0 | |
| Kimi K3 | 2.8 兆 (MoE) | Modified MIT | Moonshot AI (中国) |
| Qwen3.8-Max | 2.4 兆 (Sparse MoE) | 記載なし (非公開) | Alibaba (中国) |
並べて見えるのは、ELYZA-Thinking の 2 モデルが、数兆パラメータ級の中国発モデルとは明確に違う規模で出てきたという点です。Apache 2.0 の緩さと、手元の GPU で検討できる規模を両方備えた国産モデルの選択肢が増えたと捉えるのが実態に近い理解です。
使い始める経路は、現時点では Hugging Face の 2 つのリポジトリ (elyza/ELYZA-Thinking-1.0-llm-jp-4-33b・elyza/ELYZA-Thinking-1.0-llm-jp-4-32b-a3b) からの重みの取得だけです。対応する実行環境は vLLM・Transformers・SGLang で、公式モデルカードは vLLM での起動を推奨しています。前述のとおり API 提供は無いため、性能を確かめる最初の一歩も自社でのホストが前提になります。
採用判断に落とし込むなら
新しいオープンモデルが出るたびに、ベンチマークの見出しだけで採用を決めるのは避けたほうがよい進め方です。公表されているベンチマークは候補に入れる根拠として扱い、実際の採用判断は自社のタスクに近い作業で試した結果で決める順序が実務的です。特に今回のような「総合平均」と「言語別平均」が並ぶケースでは、どちらの数字を見て比較しているかを資料に明記しておくと、あとで見返したときの誤読を防げます。
こうした新しいモデルの評価基準づくりや、複数の LLM ベンダーを併用する運用ルールの整備は、AI 開発ツール定着支援 でご相談いただけます。
まとめ — 今すぐ何を判断すればいいか
ELYZA-Thinking-1.0-llm-jp-4 の 2 モデルについて、公式情報で確認できる範囲は次の 3 点に整理できます。
- Apache 2.0 で商用利用できますが、API 提供は無く自社でのホストが前提です (2026-10-03 確認)
- 33b・32b-a3b ともに重みの保存にはデータセンター級ではなく数十 GB 規模のメモリが必要で、4 ビット量子化まで落とせば 24GB クラスのコンシューマ GPU でも検討できる規模です。32b-a3b は保存容量こそ同程度ですが、推論の計算コストはアクティブ約 3.8B 分で済みます
- カスタマーセンター業務ベンチマークの数字は、ELYZA 自身の社内実験の結果であり、参考情報として扱うのが実務的です
評価基準づくりや複数モデルの使い分けから相談したい場合は、AI 開発ツール定着支援 や お問い合わせ からご連絡ください。



