ふくふくHukuhuku Inc.
EP.43Toolbox 10分公開:

AWSの判断AI「Strands Decider 2B」を日本語10件で試す

Strands Decider 2Bの公開仕様と、日本語問い合わせを分類する小さな検証。choiceと情報不足の判定を分け、confidenceを自動処理の許可にしない使い方を解説します。

#Strands Decider#Jev#判断モデル#日本語#検証
執筆 / 監修
松尾 亮合同会社ふくふく 代表社員

データ基盤・データパイプライン構築 / BI / 生成 AI 活用支援を専門とするエンジニア (28 年)。 本記事は AI 利用ポリシーに基づき、生成 AI の補助で執筆 → 人間が監修・編集して公開しています。

プロフィール詳細
シェア

問い合わせを担当部署へ回す、対応前に不足情報を確認する。こうした判断のたびに回答文を生成せず、用意した選択肢や評価段階で答えるのが、2026年10月1日発表のです。

に続く判断モデルを、架空の日本語問い合わせ10件で試しました。明確な8件中7件は想定分類に一致した一方、曖昧な2件のうち1件は確認へ戻せませんでした。仕様確認・試用日は2026年10月2日です。公式発表

Strands Deciderは、文章の代わりに選択や採点を返す

Strands Labsが公開したこのモデルは、小規模な実験やローカル開発向けです。一般的なの文章を作る部分を置き換え、入力と選択肢を照らして判断します。返信文や議事録を書く用途とは役割が異なります。

渡すのは、判断対象の文章、質問、回答の候補です。「請求書を再発行してほしい」という文に、請求・障害・契約などから答えさせます。候補は依頼ごとに指定できます。公式リポジトリ

質問形式返すもの業務で試す例
choice選ばれた候補、候補ごとの確率、confidence問い合わせの担当部署
noul「はい」に相当する確率内容に不足情報があるか
score順序付き段階の期待値、分布、confidence対応優先度の仮評価

部署分類ができたから、別の採点も正しいとは限りません。「急ぎ」「深刻」「重要」のどれを評価するかで正解が変わるため、判断の種類ごとに確認します。質問形式の公式説明

公開モデルを手元で試せる。初回ダウンロードは必要

公開モデルはStrandsAgents/strands-decider-2B-hobson-v19です。コードとモデルはで配布されています。モデル利用の従量課金はありませんが、機器、保存領域、電力、環境準備は必要です。公式モデルカード

公式はNVIDIA搭載環境、AppleシリコンのMac、での推論を案内しています。初回には関連ファイルと基礎モデル約4.5GBを取得します。入力文を毎回外部へ送る使い方ではありませんが、初回から通信不要ではありません。

の環境がある人向けの準備例です。以下は記事で使うコードの版と主要ライブラリを固定し、他の作業に使う環境と分けるコマンドです。環境ごとの追加条件は推論ガイドで確認してください。

Bash
python3.12 -m venv .venvsource .venv/bin/activatepython -m pip install \  'git+https://github.com/strands-labs/strands-decider.git@f91487ab8f7e4b4967ae57e46b8d90e91e67d616' \  'torch==2.7.1' 'transformers==5.17.0' 'peft==0.21.0'

で架空の問い合わせを一件確認する例です。Appleシリコン向けのmpsを指定しています。返る部署名や確率は決め打ちせず記録します。

Bash
strands-decider ask StrandsAgents/strands-decider-2B-hobson-v19 \  --device mps \  --state "先月分の請求書を紛失しました。再発行をお願いします。" \  --choice "この問い合わせを担当する部署はどれですか?=請求,障害,契約,その他,確認必要"

単体推論にはAWS契約を必須とする案内はありません。一方、公式のエージェント連携例は別途Amazon Bedrockを使います。/v1/systemoneというもありますが、Jev本体との互換性は未検証。同じ形式名だけで既存システムを置き換えないようにします。

日本語10件では、部署分類と「保留」を分けて試した

架空の問い合わせは請求・障害・契約・その他を各2件、用件が分からない文を2件用意しました。入力と期待分類は出力を見る前に固定し、期待値はモデルへ渡していません。結果を見て問題を追加・修正したり、再実行したりもしていません。

一つの入力に二つの質問を同時に渡しました。一つ目は、担当先を「請求・障害・契約・その他・確認必要」から選ぶchoiceです。二つ目は「担当部署を決めるための具体的な情報が不足していますか?」というnoulです。確認が必要な場合に、それぞれどう答えるかを別々に見ます。

採用窓口への問い合わせは用件が明確な「その他」、単に「例の件」としか書かれていない依頼は「確認必要」と決めました。こうした業務ルールを先に合わせてから、モデルを評価します。

明確8件中7件は一致。曖昧な依頼の見逃しが残った

Apple M2 Ultra・メモリ192GiB・macOS 27.0の共用Macで、Appleシリコン向けのmpsを使い、各ケースを1回ずつ実行しました。使用モデルは公開v19、コードは先ほどの固定版、主要ライブラリも導入例と同じです。モデルの読み込み完了後に10件を順番に処理しました。

入力の区分choiceの結果
内容が明確な8件7件が期待する分類に一致。1件を過剰に保留
情報不足の2件1件は確認必要。1件はその他へ分類

次の三つが確認に役立つ結果でした。noulは別質問に対する「情報不足である」側の確率であり、部署分類のconfidenceとは別です。

入力期待する分類実際のchoice情報不足のnoul
御社の採用窓口を教えてください。その他確認必要0.5328
例の件、何とかしてください。確認必要その他0.3429
困っています。担当の人につないでください。確認必要確認必要0.4770

特に最後の文では、choiceが「確認必要」を選んだ一方、noulは0.4770でした。二つの質問が同じ結論を返す保証はありません。前の「例の件」を誤ってその他へ回したchoiceのconfidenceも0.7217あり、値だけを見て任せることはできません。また、採用の依頼を保留する誤りと、情報不足の依頼をそのまま流す誤りでは、現場への影響が違います。

呼び出し時間は初回約11.56秒、その後9件の中央値は約0.86秒でした。別に記録したモデル読み込みは約4.93秒です。いずれも取得済みモデルでの値で、ダウンロード待ちは含めていません。共用Macで各1回だけ測った観測値なので、安定した処理速度や他モデルとの優劣を示すものではありません。

日本語問い合わせの教材ZIPをダウンロードできます。入力・質問・期待値、実行用のrun.py、今回の観測結果を収録しています。展開したフォルダで、先ほどの専用環境からpython run.py --device mps --output my-results.jsonを実行します。結果の一致数だけでなく、過剰な保留と見逃しを別々に記録してください。

公式のローダーは基礎モデルの現在のmainを取得するため、同じv19という名前でも後日の取得条件が変わり得ます。今回は公開モデルの取得版bb282d786bc25…、基礎モデルの取得版b1485b2fa6df…を記録しました。小試験の10件は日本語業務全体の精度を推定する標本ではなく、自社で試すべき失敗例を見つける入口です。

confidenceが高くても、業務の正しさは別に確かめる

choiceのconfidenceは、選ばれた候補の確率を候補数に応じて換算した値です。例えば5択で最高確率が0.9なら、公式の計算方法ではconfidenceは0.875になります。この計算例は実測結果ではありません。表示された0.875を、その問い合わせの正解率87.5%と読むことはできません。

は多数の判断で確かめる性質です。公式は短い分類での校正を報告していますが、別分野や日本語の自社データでも同じ関係になるとは限りません。公式評価の限界

公式資料は、質問の意味を反転させても回答が変わりにくいこと、未知の採点基準や真偽判定へ移した際に弱いことも記載しています。「該当しない部署はどれか」のような否定形を最初から多用せず、何を選ばせるかを短く肯定形で書くところから始めます。

で扱いやすい返答が得られても、まずは担当候補を人が直せる段階から始めます。製品ごとの役割はJev・Laya・Jeff・Micaの比較、画像を扱う場合はCloudflare Clefの画像分類も参照してください。

よくある質問

Strands Decider 2Bは無料ですか?
コードと公開モデルはApache 2.0で配布されています。手元での推論には機器や環境準備の費用がかかり、別のクラウドモデルと連携すればその利用料も別途発生します。
日本語に対応していますか?
今回の架空10件では、明確な8件中7件が想定分類に一致しましたが、曖昧な2件のうち1件は確認へ戻せませんでした。公式の日本語品質保証は確認できず、自社業務で別途評価する必要があります。
Jevの代わりにそのまま使えますか?
似た質問形式を持ちますが、公式推論ガイドはJev APIとの互換性を未検証としています。回答項目、confidenceの読み方、エラー時の動作、判断品質を個別に確認してください。
シェア

この記事の感想を教えてください

あなたの 1 クリックで、本当にこの記事は更新されます。「もっと詳しく」「続編希望」が一定数集まった記事は、 ふくふくが 実際に内容を拡充したり続編記事を公開 します。 送信したリアクションはお使いのブラウザに記録され、再カウントされません。

シリーズの外も探す:

まずは、現状を聞かせてください。

要件が固まっていなくて大丈夫です。現状診断と方針提案までを無料でお手伝いします。

無料相談フォームへ hello [at] hukuhuku [dot] co [dot] jp