Case 11 / Qwen3.8 で議事メモ整理
Qwen3.8 は、前回の検証で見つけた弱点を解消していた
検証環境に Qwen3.8(27B)が加わりました。最初の検証と同じ会議メモ・同じプロンプトで10モデルを比べています。7月の検証で Qwen3 の3サイズが揃って落とした項目を、Qwen3.8 は取れるようになっていました。
Conclusion
結論
検証環境に Qwen3.8(27B)が加わりました。最初の検証と同じ会議メモ・同じプロンプトで10モデルを比べています。7月の検証で Qwen3 の3サイズが揃って落とした項目を、Qwen3.8 は取れるようになっていました。
-
01
前回の検証で見つけた弱点が、Qwen3.8 で解消されていた
2026年7月に行った最初の検証で、Qwen3の3サイズが揃って落とす項目がありました。会議で「来週の役員会で承認を諮る」と決まった件を、ToDoとして書き出さないのです。承認待ち・依頼待ちの事項をタスク化する判断が弱い、という指摘でした。今回 qwen3.8:27b(Qwen3の次世代)は3回とも取れています。一方で現行世代の32B・14Bは今回も3回とも落としました。世代交代で直ったが、現行世代には残っているということです。
-
02
ただし「Qwen3系の弱点」ではなかった
同じ項目を llama3.1:8b も3回とも落としています。逆に gemma3:12b・phi4:14b・Swallow-8B は3回とも取れました。いずれも Qwen3 の32Bより小さいモデルです。モデルのサイズでも、開発元の系統でもなく、モデルごとの性質でした。「大きいモデルを選べば安全」という判断が成り立ちません。実際、20.2GBの qwen3:32b が17点、8.1GBの gemma3:12b が20点です。
-
03
3つ並んだ数値のうち、最後のひとつが落ちる
会議では「売上は前年比120%」「ROASは380%」「CVRは2.1%」と数値が3つ続けて出てきます。前の2つは30件中27件が拾ったのに、CVRを書いたのは9件だけでした。サマリーを「5〜8点に整理」と指示しているため、何かを削らざるを得ず、数値が削られています。議事メモを自動化するなら、落としてはいけない数値をプロンプトで名指しする必要があります。なお、事実にない数値の創作や雑談の混入は全モデルでゼロでした。差が出たのは取りこぼしだけです。
Input
入力:何を渡したか
実際に投入したデータを公開しています。
Process
処理:どう投げたか
プロンプトは全モデルで同一、1文字も変えていません。
Output
出力:何が返ってきたか
全30件を公開しています。クリックで出力のJSONを開きます。
Scoring
採点:どう測ったか
採点キーはモデル出力を1件も見ないうちに確定させています。実行後に基準を足したり緩めたりしていません。
Result
結果
結果
22点満点(サマリー7論点×1点 + ToDo5件×3点)。減点はノイズ混入・検討段階の誤り・ハルシネーションが各−2。
| モデル | run1 | run2 | run3 | 中央値 | ばらつき | 応答中央値 |
|---|---|---|---|---|---|---|
| claude-sonnet-5クラウド | 22 | 22 | 21 | 22 | 1 | — |
| qwen3.8:27b | 22 | 22 | 22 | 22 | 0 | 26.2秒 |
| gemma3:12b | 20 | 20 | 20 | 20 | 0 | 5.7秒 |
| qwen3:32b | 17 | 17 | 17 | 17 | 0 | 22.6秒 |
| phi4:14b | 17 | 17 | 17 | 17 | 0 | 8.4秒 |
| Swallow-8B日本語特化 | 17 | 17 | 17 | 17 | 0 | 2.8秒 |
| qwen3:14b | 17 | 16 | 16 | 16 | 1 | 11.1秒 |
| qwen3:8b | 17 | 15 | 15 | 15 | 2 | 7.3秒 |
| ELYZA-JP-8B日本語特化 | 15 | 15 | 15 | 15 | 0 | 2.8秒 |
| llama3.1:8b | 14 | 14 | 14 | 14 | 0 | 4.0秒 |
速度と出力量
| モデル | 中央値 | 出力トークン | 回答の文字数 | スコア |
|---|---|---|---|---|
| Swallow-8B日本語特化 | 2.8秒 | 296 | 429 | 17 |
| ELYZA-JP-8B日本語特化 | 2.8秒 | 307 | 455 | 15 |
| llama3.1:8b | 4.0秒 | 446 | 635 | 14 |
| gemma3:12b | 5.7秒 | 361 | 590 | 20 |
| qwen3:8b | 7.3秒 | 825 | 645 | 15 |
| phi4:14b | 8.4秒 | 582 | 722 | 17 |
| qwen3:14b | 11.1秒 | 837 | 496 | 16 |
| qwen3:32b | 22.6秒 | 763 | 519 | 17 |
| qwen3.8:27b | 26.2秒 | 2,207 | 745 | 22 |
Discussion
考察
なぜ全モデルを測り直したか
追加されたモデルだけを流して過去の数値と並べれば早い。だがそれはできなかった。
| 項目 | 検証01(2026/07) | 検証11(今回) |
|---|---|---|
| 試行回数 | n=1 | n=3 |
| 対象 | Qwen3 3サイズ + Sonnet 5 | 9モデル + Sonnet 5 |
| 採点 | 定性(◎○△×)のみ | 機械照合 + 目視 |
| 生出力 | 残っていない | 全30件を保存 |
そのため検証01のスコアと直接比較してはいけない。
タスク
架空のEC企業のマーケ月次定例(文字起こし1,435文字・参加者4名)から、 会議サマリー(5〜8点)とToDo一覧(表形式)を作らせる。
入力には次が仕込まれている(検証01の設計をそのまま使用)。
- 数値:売上前年比120%/ROAS 380%(目標300%)/CVR 2.1%(前月1.8%)/カート放棄率約7割/広告費80万→100万円
- 決定と未決定の区別:インフルエンサー起用を「まだ検討段階」「決定ではない」と明言
- 雑談ノイズ:コーヒーメーカーの話、天気・傘の話
- 期限の表現ゆれ:「7月8日までに」「7月10日を目標に」「調査してからまた相談」「来週の役員会」「次回の定例までに」
- 担当のあいまいさ:「みんなで持ち寄りましょう」(=全員)
旧世代の弱点は解消されたのか
検証01の指摘は「Qwen3の3サイズが揃って『役員会で広告費増額の承認を得る』を落とす」だった。 承認待ち・依頼待ちの事項をタスク化する判断が弱い、という内容である。
| モデル | 広告配信設計 | LP改修 | 送料調査 | 役員会での承認 | 候補リスト |
|---|---|---|---|---|---|
| claude-sonnet-5クラウド | 3/3 | 3/3 | 3/3 | 3/3 | 3/3 |
| qwen3.8:27b | 3/3 | 3/3 | 3/3 | 3/3 | 3/3 |
| gemma3:12b | 3/3 | 3/3 | 3/3 | 3/3 | 3/3 |
| phi4:14b | 3/3 | 3/3 | 3/3 | 3/3 | 3/3 |
| Swallow-8B日本語特化 | 3/3 | 3/3 | 3/3 | 3/3 | 0/3 |
| qwen3:32b | 3/3 | 3/3 | 3/3 | 0/3 | 3/3 |
| qwen3:14b | 3/3 | 3/3 | 3/3 | 0/3 | 3/3 |
| qwen3:8b | 3/3 | 3/3 | 0/3 | 1/3 | 3/3 |
| llama3.1:8b | 3/3 | 3/3 | 0/3 | 0/3 | 3/3 |
| ELYZA-JP-8B日本語特化 | 0/3 | 3/3 | 3/3 | 3/3 | 3/3 |
qwen3.8:27b は決定と未決定を書き分けている
・インフルエンサー起用は検討段階であり、候補リストの持ち寄りを次回定例までに各担当で行う。
「承認は未定」「検討段階」を明示している。 メモで「決定ではない」と明言されている事項を、決定事項として書いていない。
数値は3つ目が落ちる
サマリー7論点のうち、拾えた回数に大きな差が出た(全30件中)。
| 論点 | 拾えた件数 |
|---|---|
| 送料がカート最終段階まで出ない | 30/30 |
| 広告費 80万→100万円の増額提案 | 30/30 |
| 売上 前年比120% | 27/30 |
| ROAS 380%(目標300%) | 27/30 |
| カート放棄率 約7割 | 18/30 |
| 夏の新商品を7月中旬にローンチ | 16/30 |
| CVR 2.1%(前月1.8%) | 9/30 |
サマリーを5〜8点に収める指示があるため、何かを削らざるを得ず、数値が削られている。 実務では「落としてはいけない数値」を明示的に指定する必要がある。
Implications
実務への示唆
実務への示唆
| 論点 | この検証からわかったこと |
|---|---|
| 議事メモ作成を任せられるか | qwen3.8:27b なら任せられる水準に達した。22/22・ばらつき0で、 ハルシネーションもノイズ混入もない |
| モデルは大きいほど良いか | 違う。qwen3:32b(20.2GB)が17点、gemma3:12b(8.1GB)が20点。 サイズと精度は相関しない |
| 世代交代の効果は | あった。旧世代が揃って落とした項目を次世代は取れている。 ただし現行世代の32B・14Bには弱点が残っている |
| 速度重視なら | gemma3:12b。20点・5.7秒。qwen3.8:27b の1/5の時間で9割の精度 |
| プロンプトで補うべきこと | 落としてはいけない数値を明示する。3つ並んだ数値の最後(CVR)が 21/30で落ちた。5〜8点という字数制約が効いている |
| 何が崩れないか | 書かれていることを整形する能力は全モデルで崩れない。 ハルシネーション・ノイズ混入は0件。差は取りこぼしだけ |
Files
使用した資料一式
実際に投入したデータ、プロンプト、採点キー、出力の実物です。加工していないため、同じ条件で再現できます。