← 記事一覧へ

BLOG

家のPCでも、無料で動かせる中国製AI【MiMo】

家のPCでも、無料で動かせる中国製AI【MiMo】

それ、本当に「世界1位」なんだろうか

「重みが公開されているモデルの中で、世界1位」。
そんな見出しを見て、思わず二度見した。
しかも作ったのはシャオミ——スマートフォンや掃除機でおなじみの、あの会社だ。

調べてみると、「世界1位」というこの言い方には少し注意が必要だった。
ここでいう「重みが公開されている」というのは、モデルの中身のファイルがそのまま配られていて、誰でもダウンロードして自分のパソコンの中だけで動かせる、という意味だ。
しかも今回は使い方の制限がほとんどないライセンスで配られていて、無料でダウンロードでき、商用に使っても改造してもいい。
反対に、ChatGPTやClaudeのように、中身は配られず向こうのサーバー上でしか動かせないものは「クローズド」と呼ばれ、使うたびに料金がかかることが多い。

【MiMo】が1位を取ったのは、あくまでこの「重みが公開されている」側の中でのことであって、クローズドなモデルまで含めた総合順位では15位あたりだという。

ただ、それを差し引いても十分に面白い話だった。
中身を全部配っている側が、隠している側にほぼ並んだ、ということなのだから。
しかも配られているのは、パソコン1台に収まるくらいまで小さくした「蒸留版」も含まれている。

【MiMo】本体(Pro・Flash)は、文章だけでなく画像・音声・動画の中身を理解できる。
ただし今回GALLERIAで動かした蒸留版は文章専用で、画像を読み込む機能は含まれていない。

文章専用でも、無料でAIを使えるのなら、一度は試したい。

なぜ「クラウドに投げない」を選んだのか

正直に言うと、最初にひっかかったのは性能ではなく国籍だった。
中国製のAIに、仕事の文章や下書きを投げるのは何となく不安だった。

そこで思いついたのが、クラウドのAPIとして使うのではなく、手元のパソコンの中だけで完結させる、という方法だった。
モデルの重みファイルを一度ダウンロードしてしまえば、あとはネットに繋がなくても、無料で動く。
文章がどこかのサーバーに送られる心配がそもそも存在しない構成だ。

別のPCではなく、いつものPCで確かめることにした

最初は、隔離した別のパソコンで試そうかとも考えた。
何かあったときに、普段の仕事環境と切り離しておいた方が安全な気がしたからだ。

ただ、開発は基本的にClaude Codeで行っていて、その環境もほぼ全部このデスクトップPC(GALLERIA)に集約している。
わざわざ別の環境にデータを移すのも、開発環境を一から作り直すのも正直面倒くさい。

そこで、そもそも何が「危険」なのかを整理し直した。
ローカルで動かす以上、一度モデルの重みファイルをダウンロードしてしまえば、あとはネットに繋がなくても動く。
文章がどこかのサーバーに送られる心配がそもそも存在しない構成だ。
心配すべきはルーターの設定であって、どのパソコンで動かすかではない。

結局、普段使いのGALLERIA(RTX 4070 Ti SUPER搭載)に直接インストールすることにした。

Ollamaを入れる

ローカルでAIを動かすための土台には、Ollamaというツールを使う。
作業はすべて、Windowsに標準で入っている「PowerShell」というアプリの中で行う。
スタートメニューで「PowerShell」と検索すれば見つかる。

まずパソコンに入っているかを確認するところから始めた。
開いたPowerShellの画面に、次のコマンドをそのまま貼り付けてEnterキーを押す。

ollama --version

これでバージョンが表示されれば入っている。
表示されなければ、次のコマンドをそのまま貼り付ければインストールまで自動で終わる。

irm https://ollama.com/install.ps1 | iex

インストールが終わったら、一度ターミナルを閉じて開き直し、もう一度バージョン確認のコマンドを打てば準備は完了だ。
あとは動かしたいモデルを指定して呼び出すだけになる。
今回は、Hugging Face上で配布されていた【MiMo】の蒸留版(量子化済みで5.8GBほどのファイル)を直接指定した。

ollama run hf.co/bartowski/MiMo-V2.6-Distill-Qwen-9B-GGUF:Q4_K_M

動いたのに、何も答えない——最初の壁

ダウンロードが終わり、チャット画面らしきものが立ち上がった。
「こんにちは、あなたは誰ですか」と打ち込んでみた。

返ってきたのは、沈黙だった。

原因を切り分けるために、詳細なログを表示するオプションを付けて、もう一度シンプルな質問を投げてみた。

ollama run hf.co/bartowski/MiMo-V2.6-Distill-Qwen-9B-GGUF:Q4_K_M --verbose

結果を見て、腑に落ちた。
生成されたトークンはたったの1個。
一瞬で処理が終わっている。
GPUの使用率もモデルの読み込みも問題はなかった。
つまり、動いてはいるのに、答える前に強制的に黙らされていたということだ。

原因はモデルの設定ファイルにあった。
このモデルは、答える前に頭の中で考える過程(多くの場合「思考モデル」と呼ばれるタイプ)を持っている。
ところが自動生成された設定に、「その思考を示すタグが出てきたら、そこで生成を止める」という指示が紛れ込んでいた。
モデルが考え始めた瞬間に、口を塞がれていたようなものだ。

直し方は、その「止める」指示を含まない設定ファイルを自分で書き直し、モデルを作り直すことだった。

notepad Modelfile

中身に、思考を止める指示を外したテンプレートを書いて保存し、次のコマンドで新しいバージョンとして登録し直す。

直し方は、その「止める」指示を含まない設定ファイルを自分で書き直し、モデルを作り直すことだった。
まず、パソコンの中に置き場所を作る。
PowerShellで自分のデスクトップに移動し、

cd Desktop

メモ帳で新しいファイルを開く。

notepad Modelfile

保存するかを聞かれたら「はい」で新規作成し、開いたメモ帳に次の内容をそのまま貼り付ける。

FROM hf.co/bartowski/MiMo-V2.6-Distill-Qwen-9B-GGUF:Q4_K_M
TEMPLATE """{{ if .System }}<|im_start|>system
{{ .System }}<|im_end|>{{ end }}{{ if .Prompt }}<|im_start|>user
{{ .Prompt }}<|im_end|>{{ end }}<|im_start|>assistant
{{ .Response }}<|im_end|>"""
PARAMETER stop <|im_start|>
PARAMETER stop <|im_end|>

保存するときは、ファイルの種類を「すべてのファイル」に変更し、ファイル名を「Modelfile」として保存する(拡張子の.txtを付けないのがポイントだ。
メモ帳は放っておくと勝手に.txtを付けてしまう)。

保存できたら、PowerShellに戻って次のコマンドで新しいバージョンとして登録し直す。

ollama create mimo-fixed -f Modelfile

これで、ようやく最後まで答えが返ってくるようになった。
「1+1は?」という質問に対して、頭の中で少し考えたあと、「1+1 = 2 です。」
ときちんと返してきた。

AIに任せること、自分の手で確かめること

ここで一つ、大事な確認作業をしている。
最初「遅い」と感じたのは、実はバグとは別の話だった。
詳細ログを見てみると、生成速度自体は1秒間に80トークン以上出ており、このクラスのグラフィックボードとしては十分すぎる速さだった。
「遅い」と感じたのは、考えている過程が画面に表示されず、ターミナルが黙り込んだように見えていただけだったのだ。

「動かない」「遅い」という一次情報を、そのまま鵜呑みにしない。
設定ファイルの中身を自分の目で確認し、数字で裏を取る。
ここは今回、AIに任せず自分の手で確かめた部分だ。

まとめ

「世界1位」という見出しの正確さを疑うところから始まり、自宅の、普段使っているパソコンの中だけで、実際にAIを動かすところまでたどり着いた。
クラウドに情報を渡さない、という選択肢は、思っていたよりずっと手が届くところにあった。

ただ、正直に書いておくと、この記事のために作ったモデルは、試し終えたあと自分の環境からは消した。
文章の生成だけであれば、すでに契約しているClaudeで十分だからだ。
速さも精度も、有料のツールに、まだ分がある。

それでも、今回の一連の作業には意味があったと思っている。
月々の料金を払わずに、AIを試したり使い続けたりしたい人にとって、選択肢が一つ増えたことは確かだからだ。
パソコンさえあれば、ネットに情報を渡さず、追加費用もかけずに、AIと文章のやり取りができる。
無料でAIを使いたい、という人にとっては、今日から試せる現実的な方法になる。

AIをどこまで自分の環境で使いこなせているか、気になった方は、こちらからチェックしてみてほしい。

無料で診断してみる →

記事一覧へ →