# Jev-Omni紹介動画：日本語ナレーション台本

推奨タイトル：**Jev-Omniを試す理由。音声・画像・メール・動画をひとつの判断モデルで扱う**

完成研究に基づく編集用台本。角括弧は編集指示で、読み上げない。尺は読み方と素材の再生時間で調整する。音声・画像・メール・動画の四つに同程度の紹介時間を配分する。推奨理由は用途とワークフローであり、成績の説明は保存済みの測定結果に従う。

## オープニング

[四分割：音声波形／リンゴの写真／架空のメール／短い動画。車の映像だけを大きくしない]

音声を聞いて、問い合わせか苦情かを選ぶ。画像を見て、写っている物を選ぶ。メールを読んで、返信が必要かを判断する。そして、短い動画についても質問に答える。

この四つを、ひとつのモデルで扱えるところが、Jev-Omniをおすすめしたい理由です。入力の種類が違っても、質問と選択肢を用意して判断させる。いろいろな用途を試す入口として、この仕組みに魅力を感じました。

今回は実際の研究結果を使って、四つの使い方を紹介します。その後で、Qwen3.8-27BをベースにしたClefとも比較します。新しく登場したClefには、そのベースモデルから性能への期待がありました。期待と、実際に出た結果を順番に見ていきます。

## まず、入力を用意する

[「想定するタスク→入力を作る→独立に確認→入力を固定→モデルで判断」の図]

今回の入力は、合成音声、生成画像、架空の日本語メール、生成動画です。質問と正解の基準を先に決め、作った入力がその条件を満たすかを、予測前に確認しました。モデルの答えに合わせて正解を変えたわけではありません。

予定した40件のうち、採用できたのは35件。音声、画像、メールが各10件、動画が5件です。この35件を、同じ読み込み済みのJev-Omniモデルで判断しました。では、実際の例を見てみましょう。

## 音声：問い合わせと苦情を分ける

[A01の短い音声を再生。字幕は「配達済みなのに荷物が届かない。対応か返金を求める」の要約と明記]

最初は、お客様の音声です。「荷物が配達済みになっているのに、届いていない。対応か返金をお願いしたい」。これは、すでに起きた問題への対応を求める苦情です。Jev-Omniも苦情を選びました。

[A06を再生。字幕は「土曜日は何時に開店しますか」の要約]

一方、「土曜日は何時に開店しますか」は、通常の問い合わせです。こちらも、その区分を選びました。受付の振り分けなどを考えると、わかりやすい使い方ですね。

今回の英語音声10件では、選択肢の順番を変えた場合も含めて、どちらの順番でも10件すべてが基準と一致しました。Jev-Omniには音声ファイルそのものを入力しています。感情や声色を正確に読み取れた、とまでは言えませんが、音声からこの区分を選ぶ処理は確認できました。

## 画像：写真から物を選ぶクイズ

[I01の実際の入力画像と四択：リンゴ／洋ナシ／トマト／桃]

次は画像です。リンゴの写真に、リンゴ、洋ナシ、トマト、桃という選択肢を付けます。Jev-Omniはリンゴを選びました。画像を使ったクイズや、物の分類を試すときにも、この形でタスクを作れます。

[I06の実際の入力画像。選択肢の並びだけを変更する画面]

ただし、穴の開いた水切りボウルの例では、最初は正しいColanderを選び、選択肢を逆順にするとSaucepan、つまり片手鍋に変わりました。画像自体は同じです。

画像10件の結果は、元の順番で10件一致、逆順で9件一致。写真を判断できる便利さと、選択肢の並べ方によって答えが変わる注意点が、同じ実験の中に見えています。生成画像は事前に確認し、元のコルク抜きの課題は採用できず、予測前に卓上扇風機へ置き換えています。

## メール：人が返信すべきものを選ぶ

[T01の架空メールから質問部分を表示：「土曜日の受付は何時から何時まででしょうか」「予約なしでも入場できますか」]

三つ目は、日本語のメールです。展示会の受付時間と、予約なしで入れるかを尋ねるメールなら、まだ答えるべき質問があります。基準は「返信が必要」です。

[T06の架空メールから受領のお礼を表示]

資料を受け取ったお礼だけで、新しい依頼や質問がなければ、「返信不要」という基準になります。未対応の質問が残っているかを、選択肢として判断させるわけです。人が確認する返信待ちの一覧を作る、といった用途を考えられます。

架空メール10件では、元の順番で10件一致、逆順で9件一致でした。展示会の質問メールは、逆順で返信不要に変わりました。実際の受信箱で試した結果でも、返信を自動送信した実験でもありません。返信の見落としに使うなら、人が確認する設計が必要です。

## 動画：時間のある入力にも質問する

[V08の最初の4秒を短く表示。車の例はこの節に限定する]

最後は短い動画です。動画では、ひとつの画像に加えて、時間の変化も入力になります。今回の例は、前の車との距離が十分に保たれた場面です。独立に確認した基準はSafeで、Jev-OmniもSafeを選びました。

[V01の短い反例。テロップ：「基準 Dangerous／Jev-Omni Safe」。煽る演出や衝突映像の追加はしない]

ただし、途中で進路に差し迫った危険があると判断された別の例も、Jev-OmniはSafeと答えました。問いは、あとで回避できたかではなく、途中のどこかに即時の危険があったか、です。

採用した動画5件では、どちらの順番でも3件一致。危険とされた2件は、どちらも見落としています。動画についても判断を返す流れは動きましたが、その答えを現実の運転判断に任せられる成績ではありません。ここでは、四つの入力形式のうち、時間を含む例として見ています。

## 四つをまとめると

[表：音声10/10→10/10、画像10/10→9/10、メール10/10→9/10、動画3/5→3/5。「元の順番→逆順」]

元の選択肢の順番では、採用35件のうち33件が基準と一致しました。逆順では31件です。二つの順番は同じ入力を繰り返したものなので、独立した70件のサンプルではありません。

面白いのは、音声、画像、テキスト、動画を、同じ読み込み済みの予測モデルで扱えたことです。接続方法まで全部同一だったわけではありませんが、質問と選択肢を与えて判断させるという考え方を、四つの入力に広げられました。

## Qwen3.8ベースのClefと比べる

[「Clef：Qwen/Qwen3.8-27Bをベース」「今回の実行：コミュニティNVFP4量子化版」]

そこで比較したのが、Clefです。Cloudflareの公式モデルカードは、ベースをQwen3.8-27Bとしています。このモデルを土台にしているなら、判断の性能も期待できるのでは、というのが比較の動機です。今回動かしたのは、Clefのコミュニティ量子化版です。

[比較表：画像／メール／動画。音声欄は「今回比較していない」]

比較には、同じ画像10件、メール10件、動画5件を使いました。音声はClefとの比較に含めていません。Jev-Omni側は、先ほどの保存済みの結果を使っています。

結果は、Clefが25件すべてで、両方の選択肢順とも基準に一致しました。二つの順番を合わせた判断回数では、Clefが50回中50回、Jev-Omniが50回中44回です。この共通セットでは、Clefの成績が上でした。Jev-Omniで答えが変わった画像とメールも、Clefでは変わっていません。

だから、Jev-Omniのおすすめ理由は、四つの入力を扱うワークフローの魅力です。一方、この画像・メール・動画の課題を検討するなら、Clefも比較候補として試す価値があります。Qwenのベースモデルだけが結果の原因、と断定できる実験ではありません。

## 使うときの注意と締め

[四分割の画面に戻る。車の映像や衝突を最後の印象にしない]

今回は小さな合成データの実験です。予定した動画のうち5件は採用できず、動画の前処理も両モデルで違います。音声の確認は保存済みの文字起こしなどによるもので、すべての発音を人が確認したわけではありません。一般的な精度や速度、費用を保証する結果ではないので、自分の用途の入力でも確かめる必要があります。

そのうえで、音声、画像、メール、動画を、ひとつの判断モデルで試したいなら、Jev-Omniは面白い入口です。実際に四つのタスクを動かし、同じ入力をClefにも渡すことで、便利なところと、確認が必要なところが見えてきました。

まずは用途に合った質問と選択肢を決めて、手元の例で試してみる。Jev-Omniの対応範囲と、Clefの比較結果。その両方を、次のモデル選びに役立ててください。

---

編集メモ：結果の根拠と厳密な分母は同梱の `01_JEV_UNIFIED_DECISIONS_MAIN.md`。A01/A06、I01/I06、T01/T06、V08/V01は既存の実際の入力に対応する。字幕の日本語訳・要約を英語音声の厳密な文字起こしと表示しない。NotebookLMのWAV取り込みは新しい文字起こしで、Jev-Omniの音声分類を再実行するものではない。事故生成の失敗や緊急停止の追加実験は技術付録へ分離し、本編の主題や締めに追加しない。
