Mac Studio M3 Ultra 512GB RAMで試してみました。実際のセットアップは以下を参照してください。

大まかな説明

Mac Studio M3 Ultra 512GB RAMでDeepSeek V4.1 Flashを動かすことの利点としてはDeepSeekのオリジナルのMXFP4を再量子化せずにそのまま利用できる点にあります。つまり劣化なし。

メモリ常駐は300GBくらいなので512GBユニファイドメモリの威力が存分に活かされます。DeepSeek Engramはメモリに載せなくてもいいのって話がありますが、SSDからの読み出しでも速度への影響はほぼないですね。計算中に必要なデータを先読みできるのと搭載されているSSDがそもそも速いってはあります。TB5でも同等の速度はでるはずなのでMac側のSSDの寿命が気になる人は外部に移すのはありだと思います。readなんでそこまで気にする必要はないかな。

prefill 850tps、decode 35tps(Dsparkあり 45tps)くらいなので結構速いかなという印象。M5 Ultraではprefill4倍、decode1.5倍くらいということなのでprefill 3400tps、decode 47tps(Dsparkあり prefill速いので70〜80tpsでそう?)あたりと予想します。普通に化物。

実際に動かしてみて

pi coding agentを使って次の2つのタスクをまかせてみた

  • 簡単な3Dボクセルアートの作成
  • R18同人誌シナリオの校正

簡単な3Dボクセルアートの作成

次のプロンプトでワンショットで作らせてみました。今回はDsparkあり。

 create 3d boxel art.
 - many buildings, trees, river and cloud
 - switch light and dark
 - output single html

結果的に以下のようなものが完成。わりといいのでは?

トークンは116Kくらい。Dsparkに関してはreasoningでは動かない(おそらく意図的)でそれ以外のdecodeで動作しているようでした(Bash、Edit、Writeとユーザーへのレスポンス)。effortをxhighにしてたからか、ほぼreasoningじゃね?という感じでDsparkの恩恵はあんまりなかったな。何も教えてないのにヘッドレスChromeで実際にレンダリングして画像で上手く描けてるか検証していたのは興味深かったです。実際の業務とかだとplaywright cli用のskillを用意するとトークン効率は上がりそうです。

R18同人誌シナリオの校正

どちらかというとローカルLLMで本当に求められていることはこっちだよねということで。今回はDsparkなしで。 DeepSeek V4 preview(と0731)で壁打ちしながら作ったR18同人誌シナリオの矛盾点などの校正をしてみました。

内容についてはまぁということで、結果的にはそこそこ使えるなという感じでした。

DeepSeekシリーズの特徴としてシステムプロンプトの強制力がかなり強いので今回どうなの?って話になると思うんですが、今回もとてもよく効きました(あえてねw)。R18書いてもええんやで的なプロンプト流し込むわけですね。

校正に関しては明らかに時系列がおかしいとか口調がぶれてるとかについては有用。どっちともとれるなぁという表現については、これはしょうがないですかね。すでに存在するコンテキストに対してアクションを取るのである程度バイアスはかかるはずで、これ系で表現をちゃんと検証するならゼロからするべきですね。v4に比べて絶対に語彙は増えてるかつ速度も改善しているのであんまり前のバージョンに戻る理由はないですが。

まとめ

個人的にはOpus 5 > DS V4.1 Flash >>> Sonnet 5くらいの立ち位置という印象です。V4が256GBにたまたま噛み合っただけで、やっぱり数年はメモリ512GBは必要かなと思いました。ローカルLLMデビューしたいならM5 Ultra 512GBがでるのを待て!