ふくふくHukuhuku Inc.
EP.39Toolbox 11分公開:

LayaはJevの7.8倍速い?無料・日本語対応・「判断だけAI」の主張を検証

LayaはJevより7.8倍速いのか。公開コードと測定条件から、無料・日本語対応・誤判断の主張を検証。Macで日本語10件を試した結果と、導入前に確かめたい点を紹介します。

#Laya#Jev#判断モデル#日本語検証#ローカルAI
執筆 / 監修
松尾 亮合同会社ふくふく 代表社員

データ基盤・データパイプライン構築 / BI / 生成 AI 活用支援を専門とするエンジニア (28 年)。 本記事は AI 利用ポリシーに基づき、生成 AI の補助で執筆 → 人間が監修・編集して公開しています。

プロフィール詳細
シェア

「文章を生成せず判断だけを返すAIが、無料で、Jevの約7.8倍速い」。2026年9月30日のTechnoEdgeの記事でLayaを知った人は、問い合わせの仕分けや社内システムへの組み込みに使えそうだと感じたのではないでしょうか。

は、その候補になる公開モデルです。ただし、7.8倍は同じ条件での直接対決ではなく、「生成しない」は「判断を間違えない」という意味でもありません。本記事では公開コードと測定記録に戻り、速度、費用、日本語、長い入力の条件を確認します。

確認日は2026年9月30日。Python版は0.3.22、コードは6d942c92081fbc139e736bbd9ac0023223c29b7fを参照しました。同版での推論やとの実機比較は行っていません。後述するふくふくの測定は、実行ソフトと日付を分けて示します。0.3.22の公開記録

Layaの速度、無料、文章を生成しないという三つの主張について、比較条件と限界を整理した図
編集部作成。7.8倍は同条件での比較結果ではなく、ローカル運用にも費用と誤判断の確認が必要です。

Layaが返すのは、文章ではなく選択肢と数値

Layaは入力文と質問を読み、指定した形式で判断を返します。問い合わせなら「担当部署」「緊急度」「返金の要求があるか」を別の問いにできます。返信メールや判断理由の作文は担当しません。開発元のモデルカード

形式使い方の例出力の読み方
choice経理・技術・営業から担当を選ぶ候補のうち最も高く評価されたもの
score急ぎ度を0〜4の段階で定義する段階の番号を確率で重み付けした値。整数とは限らない
noul返金を明示的に求めているかYes側の確率として返される数値

この三つは「正しい部署へ転送した」「本当に返金が必要だった」という業務の完了とは別です。システム側で受け取れる形式に整理された判断材料であり、誤った部署を高く評価する可能性は残ります。型ごとの計算処理

「7.8倍」の元は、別々に測った待ち時間

開発元の比較表には、Layaが32.8ミリ秒、Jevが236〜276ミリ秒とあります。一方、同じREADMEの速度説明では6〜7倍とも書かれており、単独の倍率だけでは比較条件が伝わりません。開発元の比較表

比較する点Layaの32.8ミリ秒Jevの236〜276ミリ秒
実行場所Tesla T4上の多言語モデル外部のホストAPI
入力英語の支払い障害文と担当部署の3択分類など複数の評価課題
計測方法予熱3回後、20回の中央値別の第三者報告の課題別中央値
通信と準備同一プロセスで呼出。重み取得・起動は対象外外部サービスへの通信を含む

Laya側の測定コードは、GPU処理の終了を待って時間を記録しています。測ったのは既に読み込まれたモデルへの呼び出しです。初めてダウンロードする時間や、Macで動かした時間ではありません。

Jev側の出典の一つは、フランスからを呼び出した独立評価です。もう一つの比較プロジェクトにも過去の測定があり、使った課題や計測範囲に違いがあると説明されています。Laya開発元も、Jevは第三者の公表値で、自分たちは測定していないと明記しています。

編集部で範囲の中点を使って計算すると、((236+276)÷2)÷32.8 ≒ 7.80になります。ただし、この256ミリ秒は全測定の平均でも中央値でもありません。記事や開発元がこの算式で7.8としたかは確認していません。

言えるのは、この公開条件でLayaが短い待ち時間を記録したことです。入力、実行環境、通信の有無をそろえていないため、自社の処理が必ず7.8倍速くなるとは判断できません。

無料で入手できることと、運用費用がゼロなことは別

Layaのコードと公開モデルはです。コードのライセンスとモデルカードを確認した範囲では、モデル取得の個別申請は不要でした。手元で推論すれば、外部の推論APIに従量料金を払うことは必須ではありません。

ただし、処理するPCやサーバー、電力、環境構築、誤判断を調べる作業には費用がかかります。「月1,000件なら無料だから得」と結論を出す前に、現在のAPI料金と、担当者が導入や確認に使う時間を同じ期間で比べます。再配布などをする場合はライセンスの条件も守ります。

公式Python版はPython 3.10以降と、PyTorchなどの実行環境を使います。最初に重みを取得する構成なので、ローカル実行という言葉だけで初回から一切通信しないとは判断しません。外部連携を追加する場合も、送信先は別途確認します。パッケージの実行条件

日本語と8192トークンには、モデルと設定の条件がある

英語向けのLayaと、laya-multilingualは別の重みです。日本語を試すなら多言語版を明示し、どれが実際に読み込まれたかを記録します。100以上の言語に対応するという開発元の説明は、100言語で同じ品質が出るという意味ではありません。多言語版モデルカード

公式の再計測データでは、日本語100件・20択の意図分類で、多言語版は64件正解でした。これはPython版0.3.20での特定データによる結果です。日本語全般の正答率や、最新版の性能として読み替えられません。日本語を含む再計測記録

ふくふくでも、を使った日本語問い合わせの実測記事を公開しています。9月27日、Ollaya 0.7.2と多言語LayaをM2 Ultraで動かし、正解を明確に定義した16件のうち、選択が一致したのはCPU・GPUとも9件でした。残る4件は曖昧例として分けています。少数の架空例であり、今回確認したPython版0.3.22の成績ではありません。

9月30日には、別の日本語5択教材10件を、既存のOllaya 0.7.2と多言語Layaで各1回、予熱なしで実行しました。M2 Ultra・192 GiB・macOS 27.0、Metal/MLX・fp32の構成です。明確な8件では6件が一致し、1件は誤った部署、1件は不要な要確認でした。曖昧な2件は、どちらも要確認へ戻せませんでした。形式・通信のエラーはありません。

初回はモデル読み込みを含め1,612.235ミリ秒、残り9件の中央値は12.758ミリ秒でした。短時間で返ったことと、担当を任せられることは別です。旧試験とは入力と候補が異なるため、改善比較には使えません。最新Python版やJevを測ったものでもありません。新しい試行の詳細と教材で入力・期待分類・生応答を確認できます。

公開資料も更新されています。現行のベンチマーク文書は、以前の多言語集計を再現できず差し替えたことや、追加学習版の一部成績に対応する結果ファイルがまだないことを明記しています。古い比較画像だけから、Jevより精度が高いと結論を出すのは避けます。集計の修正と出典の注記

入力長にも注意が必要です。多言語版の既定は1024で、8192を使うにはmax_len=8192を指定します。質問や候補も入力の枠を使います。上限を増やしても、長い文章のどの位置にある情報でも同じように読めると保証されたわけではありません。受注メールの末尾にだけ「今回は取り消し」とあるような例は、実際の設定で確認します。

「ハルシネーションを排除」は、誤判断の排除ではない

自由な文章を生成しなければ、架空の理由文や存在しないURLを長々と作る問題は避けやすくなります。しかし、部署を間違える、否定文を取り違える、根拠のない高い点数を付けることは別の失敗です。公式も、追加学習していないモデルの弱い課題や、過信を含む制限事項を公開しています。

数値の名前もそのまま信用しないでください。Layaのchoice・scoreで返るconfidenceは、候補全体の分布がどれだけ一つに集中しているかの指標です。answer_confidenceは別の数値で、最も高い候補の確率を返します。どちらも、そのまま「この判断が正しい確率」として使える保証はありません。出力する確率と実際の正答の頻度を近づけるも、用途に合うデータでの確認が必要です。計算式と校正の前提

たとえば「confidenceが0.9以上なら自動転送」というルールは、0.9以上の回答が実際にどれだけ正しいかを、調整に使っていない別のデータで確かめてから決めます。候補数や表現を変えたら、閾値も再確認します。

導入前は、速さと誤判断を同じ入力で記録する

最初は返信や転送を実行せず、仕分け候補だけを返す試行にします。次のように、正解の明確な例と情報不足の例を先に作ると、結果を見て基準を変えてしまうことを防げます。以下は自作の教材例で、モデルの実行結果ではありません。

コピーして使う依頼文
目的:問い合わせを「経理」「技術」「要確認」の一つに分類する。
経理:請求・入金・返金についての依頼。
技術:ログイン・表示・操作の不具合についての依頼。
要確認:依頼内容が不足している、または複数部署にまたがる。

A:同じ請求書の代金を二度振り込みました。返金をお願いします。
B:パスワードを再設定しましたが、ログインするとエラーになります。
C:先ほどの件、早く対応してください。
D:二重請求に加え、管理画面にも入れません。

人の期待分類はAが経理、Bが技術、C・Dが要確認です。期待分類はモデルへ渡す入力に混ぜません。これは少数例の動作確認であり、この4件に合っただけで導入を決めるものではありません。

記録する点記録内容
再現条件実行ソフトの版、重みの版、機器、質問・候補の原文
待ち時間初回、予熱の有無、以後の各回。通信を含むかも書く
判断返った候補、期待との一致、不一致の内容
保留情報不足や複数部署を要確認に回せたか
数値confidenceなどの項目名ごとの値。別モデルの値と混ぜない

速度だけを比べるなら、同じ文・同じ問い・同じ回数を使い、初回と読み込み後を分けます。モデルを切り替える比較では、同じ型の出力が出たことに加えて、正答と保留が維持されたかを確認します。Layaの採用理由を「倍率」から「自社の仕分けで、許容できる誤りと待ち時間」に置き換えると、導入判断が具体的になります。

よくある質問

LayaならJevの契約をそのまま置き換えられますか?
同じような質問形式を使えても、判断結果や数値の意味、候補数の制約は同一ではありません。既存の正解付き入力で比較し、保留や人への引き継ぎまで確認してから判断します。
日本語対応なら、追加学習なしで本番に使えますか?
日本語を入力できることと、自社の分類に十分なことは別です。略語、否定、複数依頼、情報不足を含む例で確認し、誤転送が起きたときの影響も含めて判断してください。
8192トークンにすれば、長いメールを丸ごと任せてよいですか?
上限を指定しただけでは読み落としの検証になりません。判断に必要な一文を先頭・中間・末尾へ移した例を用意し、分類と実際に処理された入力の長さを確認します。
シェア

この記事の感想を教えてください

あなたの 1 クリックで、本当にこの記事は更新されます。「もっと詳しく」「続編希望」が一定数集まった記事は、 ふくふくが 実際に内容を拡充したり続編記事を公開 します。 送信したリアクションはお使いのブラウザに記録され、再カウントされません。

シリーズの外も探す:

まずは、現状を聞かせてください。

要件が固まっていなくて大丈夫です。現状診断と方針提案までを無料でお手伝いします。

無料相談フォームへ hello [at] hukuhuku [dot] co [dot] jp