手元のPCでAIを動かしたいとき、モデルを選ぶだけでは準備が終わりません。モデルを読み込み、PCの計算資源を使い、アプリからの質問へ応答する実行基盤も必要です。その新しい候補が、です。
公式サイトでは「より最大2倍高速」と紹介されています。ただし、これは特定の機器・モデル・処理条件での開発元の比較です。日本語の回答が2倍正確になる、仕事が半分の時間で終わる、という意味ではありません。本記事では2026年10月2日時点の0.2.3を基準に、比較条件と最初の試し方を確認します。公式サイト
Magnitudeは、モデルをPCで動かすための実行基盤
Magnitudeは、文章を考えるモデルそのものではありません。公開モデルを読み込み、使用する機器に合わせて計算処理を調整する推論エンジンです。デスクトップアプリからモデルを選び、普段使っているなどを接続できます。
macOS・Windows・Linux向けに配布され、や、での利用が案内されています。ただし、すべての機種で同じ速さになるわけではありません。ソフトウェアはですが、実際に動かすモデルの利用条件は別に確認します。モデルのファイル容量に加え、実行中のメモリも必要です。公式リポジトリ・モデル一覧
新しい推論基盤へ更新された0.2.0は日本時間9月30日22時54分に公開され、10月1日9時24分の0.2.2では接続やモデル評価などの修正、11時25分の0.2.3ではWindowsの導入関連の修正が入りました。既存リポジトリ全体の初公開とは区別します。公式リリース履歴
「最大2倍」を読むときは、KVキャッシュの条件も見る
公式の比較はQwen3.6 35B-A3B、重み4ビット、文脈長64kで、投機的デコーディングを使わない条件です。以下は開発元の公表値であり、編集部が追試した結果ではありません。は1秒間に処理するトークン数で、表では入力の読み取りと出力の生成を分けています。
| 機器・処理 | llama.cpp | Magnitude |
|---|---|---|
| Mac M4 Pro・48GB:入力処理 | 466 tok/s | 507 tok/s |
| 同:出力生成 | 30 tok/s | 57 tok/s |
| DGX Spark:入力処理 | 2,033 tok/s | 2,507 tok/s |
| 同:出力生成 | 49 tok/s | 58 tok/s |
表は公式サイトに掲載された丸め値です。公式の比較表
さらに、Hacker Newsでの開発者の説明では、長い文章の末尾を繰り返させる課題を使い、Magnitudeのはキー8ビット・値4ビット、llama.cppは16ビットでした。KVキャッシュは処理済みの文脈を保持する仕組みで、精度を落として省メモリ化するの設定も結果に関わります。同じモデル名でも、キャッシュまで同一条件ではありません。 開発者による比較条件の説明
公開値は実行構成を含む比較として読みます。エンジン単体の差を測る場合は、キャッシュも条件を揃える必要があります。自分の仕事では、回答の正しさ、最初の文字までの待ち時間、最後まで終わる時間、メモリ使用量を一緒に見たいところです。
最初は小型モデルと、正解を確認できる一問から
通常は公式ダウンロードからアプリを入れ、Discoverでモデルを選びます。最初から大きなモデルを選ぶより、短い日本語の入力を一つ送り、出力を目で確認するほうが問題を切り分けやすくなります。モデルの日本語能力と、実行基盤の動作は別々に評価してください。
導入後のCLIでは、次のコマンドで稼働状況、検出した機器、選べるモデルを確認できます。これは公式手順の紹介です。編集部の後述の試用は推論部品を直接起動したため、通常のデスクトップ導入手順全体を通したものではありません。
magnitude statusmagnitude hardwaremagnitude catalog listモデルは表示されたIDを確認してから取得します。以下の 1B Q4は確認時のカタログにある小型モデルの例です。catalog pullはモデルをダウンロードし、models loadはPCのメモリへ読み込みます。別々の処理なので、途中で止まった場合もどちらの段階かを記録します。
magnitude catalog show 'minicpm5-1b:gguf:q4'magnitude catalog pull 'minicpm5-1b:gguf:q4'magnitude models status 'minicpm5-1b:gguf:q4'# ダウンロード完了を確認してから実行magnitude models load 'minicpm5-1b:gguf:q4'モデルの取得や評価はバックグラウンドで進むため、状態表示で完了を確かめます。画面を開かずに動かすmagnitude serveもありますが、同じユーザーでデスクトップと複数のサーバーを同時起動する手順ではありません。公式CLIリファレンス
編集部の試用範囲と結果
編集部は、通常アプリに同梱される推論部品を公式リリースから取り出し、一時フォルダに隔離して直接起動しました。モデルの取得とローカルAPIの起動までは成功しましたが、最初の日本語リクエストはモデルの読み込み中に失敗し、回答は得られませんでした。 デスクトップの画面操作や通常CLI全体の試用ではありません。
| 試用条件 | 内容 |
|---|---|
| 日時・機器 | 2026年10月2日、M2 Ultra・192GiB、macOS 27.0 |
| 配布版・モデル | Magnitude 0.2.3の推論部品、MiniCPM5 1B Q4_K_M |
| モデルの固定 | 公開版3d55fac8…、約688MB、取得後SHA-256照合 |
| 設定 | Metal選択、最大文脈131,072、生成上限128、thinking無効を指定 |
下の節と同じ会議メモを一度だけ送りました。応答はHTTP 409のmodel_load_failedで、Metalの処理準備において「512スレッドを要求したが、上限は384」というエラーでした。これは今回の機器・モデル・直接起動の構成での結果です。全Macや通常アプリでも必ず失敗するとは判断できません。
モデルの保存容量が小さくても、読み込みと計算処理の準備が通るとは限りません。今回は速度・日本語の要約品質・エージェント連携を評価できていません。追加モデルでの再試行はせず、サーバーを終了しました。試用モデルの固定版
業務では「速いか」の前に、残す事実を決める
今回の社内メモの短文化では、入力を次のような架空の文章に固定しました。「会議は10月6日10時から。会場は未定。資料は10月5日17時までに提出してください。」依頼は「上の内容を、日本語で短く要約してください。日時と期限、未定の情報は省略しないでください。」です。次の条件も事前に固定しました。今回は回答を得られなかったため、通過結果ではなく次に確認する項目です。
| 確認項目 | 通過条件の例 |
|---|---|
| 会議の日時 | 10月6日10時を保つ |
| 提出期限 | 10月5日17時を保つ |
| 未確定の扱い | 会場を勝手に決めず、未定とする |
| 表現 | 日本語で要約し、元にない依頼を足さない |
この一問で通っても、一般的な業務精度が証明されたわけではありません。次に日付が似た資料、変更前後の指示、情報不足の例を増やします。誤りが多い場合、速度設定を追い込む前に、モデルや依頼の書き方を見直すほうが有益です。分類だけが目的なら、文章生成とは役割が異なる判断モデルの比較も選択肢になります。
比較時は機種、メモリ、OS、Magnitudeとモデルの版、モデルファイル、文脈長、生成上限を残します。初回の読み込みや機器向け調整を含む時間と、準備後の時間も分けます。短い質問一つが速かったことを、長文や複数エージェントの速度へ一般化しないためです。
無料・ローカルでも、接続先とモデルの条件は別
手元のモデルを使う推論に、クラウドAPIのトークン従量料金はありません。一方で、PCの購入費、電力、モデルの保存容量は必要です。また、Magnitudeに接続するエージェントがWeb検索や外部ツールを使えば、その通信や料金は別に発生し得ます。「ローカル推論だから、周辺ツールを含めた全作業がオフライン」とは決めつけないでください。
まずは機密情報を含まない短文で、PC内だけの経路を確かめる構成が扱いやすいでしょう。外部アプリから接続する場合は、の互換性がモデルの回答品質まで保証するわけではない点も確認します。設定を変える前に接続先とモデル名を控えておくと、元の構成へ戻す判断がしやすくなります。
なお、0.2.2の更新には、ハードウェア評価をカーネル実行からメモリ帯域に基づく推定へ変更したとの記載があります。アプリに示される推定と、自分の文章を実際に処理した結果は分けて記録してください。0.2.2の変更点