Case 02 / 資料要約
いちばん大きいモデルが、いちばん遅かった
日本語の戦略資料(PDF)を5つのモデルに要約させました。 32Bは282秒、14Bは21.5秒。13倍の差がつき、8Bよりも32Bのほうが遅いという逆転も起きています。
Conclusion
結論
日本語の戦略資料(PDF)を要約させ、5つのモデルで比べました。 入力が社内資料のため、この検証だけは要約の中身を公開できません。 公開できるのは、応答時間・出力量・日本語の品質に関する所見です。
-
01
いちばん大きいモデルが、いちばん遅かった
同じ資料を要約させたとき、32Bは282秒、14Bは21.5秒でした。13倍の差です。 8B(58.4秒)よりも32Bのほうが遅いという逆転も起きています。 Qwen3が回答前に「考える」動作(thinking)を挟むためとみられ、 モデルが大きいほど時間がかかる、という単純な話でもありません。 実運用では thinking のオン/オフや量子化の設定が、応答速度を大きく左右します。
-
02
8Bの見出しに、中国語の漢字が混ざった
Qwen3 8B は見出しに簡体字を出しました。「戦略」と書くべきところが「战略」になっています。 内容は合っていても、そのまま社外に出せる日本語ではありません。 32B・14B・minimax-m3・Claude Sonnet 5 では起きませんでした。 多言語モデルを小さいサイズで使う場合、日本語として正しく書けるかを別途確認する必要があります。
-
03
要約なら、14Bが速度と品質の釣り合う点だった
14Bは21.5秒で、日本語の品質にも問題がなく、出力の構造も過不足がありませんでした。 メモリ24GBクラスのMacで動く現実性も含めて、要約用途の第一候補になります。 一方 minimax-m3 は約246GBあり、手元のマシンで動かすことは事実上できません。
Input
入力:何を渡したか
他のケースと違い、このケースの入力と出力は公開していません。
渡したのは自社の事業戦略に関する資料(日本語のPDF)です。実在の計画・数値を含むため、資料そのものも、モデルが生成した要約も公開できません。要約は資料の中身を書き写したものになるためです。
そのうえで、入力の中身に依存しない指標——応答時間・出力トークン数・日本語としての正しさ・必要メモリ——は、そのまま公開しています。
Process
処理:どう投げたか
全モデルに同じ資料・同じ指示を渡しています。
| 項目 | 設定 |
|---|---|
| 実施 | 2026年7月 |
| タスク | 日本語の戦略資料(PDF)の要約 |
| 対象モデル | qwen3:32b / 14b / 8b(Q4_K_M)、minimax-m3(UD-Q4_K_M) |
| 基準線 | claude-sonnet-5(AWS Bedrock) |
| 実行環境 | AWS EC2 g6e.xlarge(L40S ×1)/ minimax-m3 のみ g6e.12xlarge(L40S ×4・CPU-MoE) |
| 試行 | 各1回(n=1) |
Scoring
採点:どう測ったか
7つの軸で評価しました。このうち公開できるのは後半の4軸です。
| 評価軸 | 見るもの | 公開 |
|---|---|---|
| 網羅性 | 資料の主要論点をどれだけ拾えたか | 非公開 |
| 忠実性 | 資料にない内容を作っていないか | 非公開 |
| 構造化・可読性 | 見出し・箇条書きの整い方 | 公開 |
| 日本語品質 | 日本語として正しく書けているか | 公開 |
| 簡潔性 | 出力量が適切か | 公開 |
| 応答速度 | 返ってくるまでの時間 | 公開 |
| ローカル実行容易性 | 手元のマシンで動くか | 公開 |
Result
結果
速度と実行環境
| モデル | 応答時間 | 出力トークン | 実行環境(今回) | 手元のMacで動かすなら |
|---|---|---|---|---|
| qwen3:32b | 282.3秒 | 1,159 | g6e.xlarge(L40S ×1) | 統合メモリ48GB以上 |
| qwen3:14b | 21.5秒 | 1,009 | g6e.xlarge(L40S ×1) | 24GB以上で快適 |
| qwen3:8b | 58.4秒 | 1,428 | g6e.xlarge(L40S ×1) | 16GB以上で快適 |
| minimax-m3 | 115.9秒 | 827 | g6e.12xlarge(L40S ×4・CPU-MoE) | 事実上不可(約246GB) |
| claude-sonnet-5クラウド | — | — | クラウドAPI | — |
出力の構造と量
| モデル | 出力トークン | 構造の特徴 |
|---|---|---|
| qwen3:32b | 1,159 | 見出しと区切り線で整理。網羅的だがやや長い |
| qwen3:14b | 1,009 | 太字見出し+要点の箇条書き。過不足なくバランスが最良 |
| qwen3:8b | 1,428 | 5セクション+まとめで最も冗長。情報は多いが重複気味 |
| minimax-m3 | 827 | 比率を表で表現するなど工夫。最も簡潔 |
| claude-sonnet-5クラウド | — | 見出し+箇条書きで簡潔かつ網羅。基準線 |
Discussion
考察
速度の逆転はなぜ起きたか
32B(282秒)が8B(58秒)や14B(21.5秒)より大幅に遅くなりました。Qwen3 が回答前に思考過程を生成する動作(thinking)や、量子化・文脈長の設定が影響しているとみられます。パラメータ数だけを見て所要時間を見積もると、10倍以上外れることがあります。
簡体字の混入は、内容の誤りとは別種の欠陥
8Bが出した「战略」は、意味としては正しく「戦略」を指しています。要約の中身が間違っているわけではありません。それでも、日本語の文書としてはそのまま使えません。
精度を「内容が合っているか」だけで測ると、この種の欠陥は見落とします。軽量モデルを採用するときは、日本語として正しく書けるかを別の観点として確認する必要があります。
Implications
実務への示唆
| 論点 | この検証からわかったこと |
|---|---|
| 要約タスクの既定モデル | qwen3:14b。速度・必要メモリ・日本語品質のバランスが最良。16〜24GBクラスのMacで動く現実性も高い |
| 網羅性を優先するなら | qwen3:32b。ただし応答が遅く、GPU・メモリ要件も上がる。バッチ処理や非同期の用途向き |
| 8Bを使う場合 | 日本語品質のリスクがあるため、そのまま最終成果物にしない。人手の校正か、後段のプログラムでの整形を前提にする |
| 超大型モデル | minimax級は約246GBでローカル提供の対象外。中小企業向けの選定では外してよい |
| クラウドとの使い分け | この検証は要約タスク。方針検討のような難度の高い業務は、引き続きクラウド最上位を使う前提で考える |