本文へ移動
NEWS
開発・技術

llama.cpp、GLM-5.3-Flash対応も24GBのMacで試せない

読了 約6分
llama.cppのロゴと韓国語の説明文が青い回路基板風の背景に並ぶタイトル画面。llama.cpp、GLM-5.3-Flash対応も24GBのMacで試せない
この記事の要点

llama.cpp 0.6.0が10月5日に公開され、320BのGLM-5.3-Flashへの対応とMetalの高速化が入った。編集部のM4 Proで新旧を比べると、8本同時の生成は4回とも2倍を超えた。一方でGLM-5.3-Flashは24GBのMacでは試せなかった。

みんなの意見

この速さならllama.cppを0.6.0へ上げますか?

まだ回答がありません。最初の1票をどうぞ

SHARE
320BGLM-5.3-Flashの規模
3倍Metalの行列演算(最大)
1.5倍Qwen4Expの生成速度

v0.6.0は10月5日公開 GLM-5.3-Flashに対応

ggml-orgは10月5日(現地時間)、手元のPCでLLMを動かすソフト「llama.cpp」のv0.6.0を公開した。GitHubから0円でダウンロードでき、ライセンスはMITだ。柱は新しいモデルへの対応とApple GPU向けの高速化の2つになる。

新しく動かせるのは、Zhipu AIのテキストと画像を扱う総パラメータ320Bのモデル「GLM-5.3-Flash」などだ。124Bのマルチモーダルモデル「Ling 3.0 VL」も加わり、判断モデルの「Clef」と「Nimble」にも対応した。

Qwen4Expは対応の質が上がった。MTPを使った投機的デコードで、DGX Spark上の生成速度は約1.5倍になるという。このほか多くの不具合が直り、Web UIも作り直された。

開発者向けには、トークンと埋め込みを混ぜて渡せるバッチAPI「llama_batch_ext」と「llama_process()」が入った。サーバー機能には判断モデル用の「/v1/systemone」ができた。「/v1/embeddings」は画像・音声・動画の入力を受け付け、「/v1/models」はモデルの入出力の種類を返すようになった。

llama.cpp v0.6.0の公開ページ
llama.cpp v0.6.0の公開ページ / 出典:llama.com / 制作:AInformation
これまでの流れ
  1. 10/5Metalの少数行カーネル(#29869)が取り込まれた
  2. 10/5ggml-orgがllama.cpp v0.6.0を公開
  3. 10/6Mac用の実行ファイルが入ったb11438が出た

Metalの約3倍はM1〜M4向け 効くのは同時生成だ

Apple GPU向けの高速化は、使い方によって効き方が変わる。Metalには投機的デコードとバッチデコード向けの少数行の行列演算カーネルが入り、行列演算は最大で約3倍速くなった。F16のKVキャッシュ向けのフラッシュアテンションも新しく実装された。

GitHubに載っている変更の説明(#29869)を読むと、新しいカーネルは2〜16行をまとめて計算する場面のためのものだ。複数の会話を同時に流すときや、下書きのトークンをまとめて確かめる投機的デコードが当たる。対象はテンソルAPIを持たないM1〜M4世代のApple GPUと書かれている。

社内で1台のMacにllama.cppのサーバーを立てて、数人で同時に使う構成なら効きやすい。逆に1人が1問ずつ聞く使い方は、この変更の狙いから外れる。

GLM-5.3-Flashの公式の重みは328.4GB

対応モデルの目玉であるGLM-5.3-Flashは、手元のMacで動かす話とは分けて考えたい。AInformationが10月6日にHugging Faceの公式の置き場を見た。1つ5.36GB前後のファイルが62個に分かれ、置き場の合計は328.4GBあった。

DGX Spark向けに公開されていた2ビットのGGUFでも84.9GBだ。編集部のMac(M4 Pro・メモリ24GB)では、GLM-5.3-Flashは試すことができなかった。動かすなら、メモリの大きい機械を別に用意することになる。

GitHubのllama.cpp v0.6.0公開ページの画面。GLM-5.3-Flashへの対応とMetalの行列演算が約3倍速くなる変更が並ぶ
llama.cpp v0.6.0の公開ページに並ぶ主な変更 出典:github.com(2026年10月6日時点の画面)

M4 Proで8本同時に生成 新版は4回とも2倍超だった

8本を同時に生成させると、新版は4回とも旧版の2倍を超える速さだった。AInformationは10月6日に編集部のM4 Proで2つの版を比べた。旧版は高速化が入る直前のb11400(0.5.0-dev)、新版はv0.6.0の後のb11438(0.6.0-dev)だ。

モデルはQwen2.5-1.5B-Instructの4ビット版(Q4_K_M・1.1GB)を使った。測り方は付属のllama-batched-benchで、128トークンを読ませてから128トークンを生成させた。新旧を交互に4回ずつ流し、生成の速さ(トークン/秒)を並べたのが次の表だ。

回 8本同時・旧版 8本同時・新版 1本・旧版 1本・新版
1回目 90.20 339.01 119.26 129.19
2回目 75.33 194.39 60.13 96.78
3回目 49.47 115.92 21.52 28.16
4回目 46.41 106.26 27.64 38.64

いちばん差が出た1回目は、90.20から339.01トークン/秒へ上がった。1本だけの生成も4回とも新版が上回ったが、差は8本同時より小さかった。測定中は同じMacで別の作業も動いていて、速さそのものは回ごとに大きく揺れている。

そのため新旧は同じ回の中で並べて比べた。1.5Bの小さいモデル1つで4回だけ測った結果で、大きなモデルでは差が変わる可能性がある。

Hugging FaceのGLM-5.3-Flashのファイル一覧の画面。5.36GBのファイルが62個に分かれて並ぶ
GLM-5.3-Flashの公式の置き場のファイル一覧 出典:huggingface.co(2026年10月6日時点の画面)

Mac版はv0.6.0のページに無い 番号つきの版から落とす

Macで試すなら、v0.6.0の公開ページではなく番号つきの版から実行ファイルを取る。10月6日時点でv0.6.0のページに付いているのは小さなテキストファイル1つだけで、Mac用の実行ファイルは無かった。b11438のページには「macOS Apple Silicon (arm64)」の版があり、約12MBだった。

試す順番は次の3つだ。

  • 番号つきの版からmacOS arm64版を落として展開する
  • ふだん使っているGGUFのモデルを1つ用意する
  • 新旧の両方でllama-batched-benchを流し、同時に流す本数を1と8で比べる

社内のMacでサーバーを動かしているなら、まず同時に何人が使っているかを数えておきたい。同時の利用が多い職場ほど、今回の版へ上げる理由ははっきりする。

Macでllama.cppの新版を試す手順。番号つきの版を落とす。macOS arm64版は約12MB。GGUFを1つ用意する。ふだん使うモデルでよい。新旧で速さを比べる。同時に流す本数は1と8。8本同時は4回とも2倍超だった。AInformation編集部が作ったイラスト図解(横並びの手順コマ)
Macでllama.cppの新版を試す手順 / 制作:AInformation
藤井俊太(AI導入コンサルタント)の見方

社内の文書を外へ出せない部署では、1台のMacにllama.cppのサーバーを立てて数人で使う形がある。この形なら今回の版はそのまま待ち時間の短さに出そうだ。一方で1人が1問ずつ聞くだけなら、上げても体感はあまり変わらないとみている。情報システム部門は、上げる前に同時に何人が使っているかを数えておきたい。GLM-5.3-Flashのような大型モデルへの対応は、手元のMacで動くかどうかとは別の話として切り分けたほうがよい。

よくある質問
llama.cpp 0.6.0はいくらで使える?
0円で使える。llama.cppのv0.6.0はGitHubから無料でダウンロードでき、ライセンスはMITだ。Macで動かす実行ファイルはv0.6.0のページには付いておらず、b11438のような番号つきの版に入っている。10月6日時点でmacOS arm64版は約12MBだった。
GLM-5.3-Flashは手元のMacで動く?
メモリ24GBのMacでは試せなかった。llama.cpp 0.6.0はGLM-5.3-Flashに対応したが、総パラメータは320Bある。Hugging Faceの公式の置き場はファイルの合計が328.4GBで、DGX Spark向けの2ビット版でも84.9GBだった。動かすにはメモリの大きい機械が要る。
Metalの高速化はどのMacで効く?
テンソルAPIを持たないM1〜M4世代のApple GPUで、複数の会話を同時に流すときに効く。公式の説明では行列演算が最大で約3倍速くなる。AInformationがM4 Proで8本同時の生成を4回測ると、新版はいずれも旧版の2倍を超えた。1本ずつの生成は差が小さかった。

この記事の出典

補助資料

  • [1]PC WatchPC Watch・補助的な二次資料・確認 2026-10-06この記事の元にした報道

出典の最終確認日:2026年10月6日

次に読むNEXT
SHARE

広告を載せており、そこから申し込みがあると紹介料を受け取ることがあります。

よく読まれている定番ガイド60本
この記事に出てくるAIも、まとめて比べられます 497本のAIツールを、やりたいこと・料金・日本語対応で絞り込めるデータベースです。5日ごとに料金を取り直しています。 AIツールを探す

あわせて読みたいRELATED