高性能なAIへ、調査から修正まで全部任せる。分かりやすい方法ですが、小さな作業にも高い単価を使うことになります。作業を分け、難しさに応じて担当モデルを選べば、費用は変わるのでしょうか。
は9月30日、を使って担当を選ぶ開発構成について、モデル費用が57.1%低かったという検証報告を公開しました。注目したいのは、トークンを減らして得た数字ではないことです。Halv側の処理量は約3.49倍に増えています。
本記事は2026年10月1日の公式資料と公開データを確認したものです。編集部は84件の実行要約を独自に集計し直しましたが、Halvをインストールして課題を解き直したわけではありません。提供元の請求明細や、非公開の会話記録も監査していません。
1. Jevが担当を選び、別のモデルが作業する
Halvは、複数のコーディング用をまとめて使うデスクトップ環境です。今回の比較は単独と、CodexにHalvの仕組みを加えた構成が対象です。Jevがコードをすべて生成するという意味ではありません。
公開記録では、どちらも統括役にを使います。Halv側はによる事前調査を挟み、Jevが主担当のモデルとを選びます。主担当が必要に応じて安価な担当へ一部を渡し、最後に統括役が結果を確認します。コードの索引や、ツール出力・文脈の整理も併用しています。公開データの構成条件
つまり、変えたのはモデル選択だけではありません。57.1%をJevだけの効果として切り出すことはできません。判断モデルと実行ツールの違いは、Jev・Laya・Jeff・Micaの比較記事でも整理しています。
2. 「42件」の中身は、14課題を3回ずつ
対象はSWE-rebenchの14課題です。それぞれ3回ずつ、両構成で実行しているので、片側42回、合計84回です。111課題の計画の途中で集計した報告であり、42種類の独立した仕事を試したわけではありません。
次の表は、公開された各実行の値を編集部で再集計したものです。「通過」は公開記録にある課題用の採点結果を指し、人があらゆる不具合や保守性まで保証したことを意味しません。集計元の42組のデータ
| 指標 | Codex単独 | Codex+Halv |
|---|---|---|
| 実行回数 | 42回 | 42回 |
| 採点を通過した回数 | 25回 | 25回 |
| 通過率 | 約59.5% | 約59.5% |
| 記録されたモデル推定費用 | 337.501056米ドル | 144.666190米ドル |
| 入力+出力トークン | 48,755,656 | 170,114,775 |
| 通過1回あたりの推定費用 | 約13.50米ドル | 約5.79米ドル |
費用の減少率は「1 − 144.666190 ÷ 337.501056」で約57.136%です。小数第1位に丸めると57.1%になります。公開アーカイブ89ファイルのハッシュ、各実行とセッション内訳、入力・出力・費用の合計も照合しました。ただし、ファイルが整合していることと、記録の内容を独立に実証したことは別です。
数は増えても、安いモデルに回す量が増えれば費用は下がり得ます。一方で、全体の通過数が同じでも各課題の結果は同じではありません。公開データには、単独構成が3回とも通過した課題でHalv側は1回だった例や、Halv側の費用が高くなった課題もあります。「品質を保ったまま必ず安くなる」とは読めません。
3. 月額料金とJevの費用は、別の欄で読む
この金額は、選ばれた実行の統括役と作業担当の利用量から計算したモデル費用の推定値です。月額プランの請求額ではありません。公開されたセッションの費用欄はAstra・Sol・Lunaのもので、Jevの利用費が別行で記録されているわけではありません。
現行のHalv公式料金説明では、月額10米ドルのプランにJevによる担当選択を含み、ルーティングの別料金はないとしています。7日間の無料体験にはカードが必要で、期間後は自動更新です。使うエージェントの契約は別途必要です。これは「Jevの運用費が存在しない」という意味でも、144.67米ドルがHalvを使う総費用という意味でもありません。
また、見出しの集計には除外があります。現行の実行台帳では無効扱いの試行13件、変更を取り消した別実験10件が比較対象から外れています。既知の推定費用はそれぞれ約25.53ドル、約40.79ドルで、金額が記録されていない試行もあります。通常の採点不合格は選定後の集計に残っていますが、実験全体で使った総額は見出しの数字から分かりません。試行・除外の台帳
自分の会社で判断するときも、モデル推定費用、月額料金、再試行、人の確認時間を分けます。定額契約の料金は、処理量が減っただけで自動的に下がりません。余った利用枠と、実際に減った支払いを同じ「節約」と呼ばないことが大切です。
4. 最新版と、報告に使った構成を混ぜない
10月1日午前5時13分35秒に公開されたHalv v0.6.4では、事前調査・主担当・補助担当へ分ける仕組みや、モデル選択の更新が案内されています。現行版はGPT-6.1 Solなどへ追随しますが、今回の記録にはとLunaが使われています。最新版を入れれば同じ数値になる、という検証ではありません。
公式ダウンロードにはmacOSのApple Silicon・Intel、Windows x64、Linux向けの配布があります。手元でコードの整理を行っても、選んだモデルへの要求にはプロンプトや必要な文脈が送られます。完全に端末内で完結する道具だと考えず、最初は持ち出し可能な小さな検証用コードで確認します。日本語の依頼での成績や、この環境での動作は編集部では未確認です。
5. 自分の仕事では「安さ」より先に合格条件を固定する
試す題材には、たとえば社内CSV取込機能の小さな修正が向いています。「重複IDを除く」「空欄はエラーにする」「既存の出力列を変えない」と、確認できる条件を先に書きます。成功条件を結果を見てから変えると、安いほうに都合よく採点してしまいます。
両構成には同じ開始時点のコード、依頼文、テスト、上限時間を渡します。片方が作った修正をもう片方の出発点に混ぜず、実行順も偏らせません。一度の成功だけで採用せず、同じ課題を繰り返して、金額と結果のばらつきを見ます。これは編集部の試用案で、実行済みの結果ではありません。
記録は、次の項目から始められます。空欄を推定値で埋めず、分からない費用は「未取得」と残します。
課題ID・開始コードの版・依頼文の版:合格条件・テスト結果:Halv / Codex / 実際のモデル / 推論設定の版:開始・終了・人が確認した時間:全担当の入力 / キャッシュ済み入力 / 出力:モデル推定費用 / 取得できた請求額:再試行・中断・失敗とその費用:月額追加費用 / 人の修正時間 / 採用判断:が入力合計に含まれる記録では、処理量にもう一度加えません。費用は実際のモデルと料金条件ごとに集計し、統括役だけを測って安く見せないようにします。通過1回あたりの費用にも失敗分を含め、通過がゼロなら割り算の結果を出しません。
公開の数字は、試す理由にはなります。採用を決める材料は、自分たちの修正で必要な品質を満たし、再試行や確認作業まで含めて負担が減るかです。Halvの今回の報告は、その比較を始めるための具体的な記録として読むと役立ちます。