声、 映像、そして全ての記録の中の言葉を分析します。
You can now analyze tone and visuals in Speak AI, not just words. Audio analysis reads tone, emotion, energy, and more. Visual analysis reads body language, screen sharing content, facial expressions, and more. Multimodal analysis is the engine behind AI-native sales acceleration: the words, the voice, and the visuals, scored together.
Sarah K.
Jordan T.
音声、動画、文字起こしを1か所で分析します。
文字起こしが捉えられなかった瞬間を探して、通話を聞き直したり動画を見直したりするのに何時間も費やします。それは文字起こしのみの盲点です。その洞察は誰かの声の調子やスクリーンの共有内容の中に全時間あったのです。Speak AIは音声、動画、テキストを1か所で分析するため、言葉以外の何も失われません。
Transcript analysis
全ての文字起こしはテーマ、感情、キーワード、構造について分析されます。これはいつもSpeak AIを支えてきたレイヤーで、単独で立つのではなく音声と動画分析と一緒に機能します。
Audio analysis
調子、感情、エネルギーなどを分析します。Speak AIは何が言われたかだけでなく、どのように言われたかを聞きます。会議、インタビュー、電話、アップロードする全ての記録で。
ビデオ分析
身振り、スクリーン共有内容、表情などを抽出します。記録に動画がある場合、Speak AIはカメラとスクリーンで何が起きたかを読み取ります。音声トラックだけではなく。
Speak AI内でマルチモーダル分析がどのように機能するか。
これは切り替える別のツールではありません。既に使用しているプラットフォームに全体的に統合されています。
あなたの記録
動画、音声、またはテキストをアップロードまたは記録します。既に行っているのと同じ方法で。
Speak AIが一緒に読み取ります
音、映像、言葉は単一のパスで一緒に分析されます。同じ記録に対して3つの別々のツールが機能するのではなく。
どこでも使用します
同じ分析がAIチャット、オートメーション、フィールド、ダッシュボード、そしてミーティングアシスタントに表示されます。既に機能している場所ならどこでも。
音声と動画が分析の一部になったら質問できることを。
Speak AI内からの実際のプロンプトペア。各ユースケースにはオーディオの質問と動画の質問があります。2つのモダリティは異なるものを表面化させるからです。
会議
音声: 「試してみてください: このミーティングでエネルギーはどこで落ちましたか?」
動画: 「共有画面に表示されていた内容は、決定を下した時点で何でしたか」
インタビュー
音声: 「この参加者はどの部分で躊躇しましたか」
動画: 「価格について質問した時、相手の顔にはどのような変化がありましたか」
電話通話
音声: 「価格設定が話題に上がった後、トーンはどのように変わりましたか」
動画: 「異議を唱えた時点で、画面に何が表示されていましたか」
調査
音声: 「どの回答が中立的ではなく、不満を感じさせるように聞こえますか」
動画: 「回答者がカメラに映した内容のうち、テキストでは捉えられなかった部分は何ですか」
レコーダー
音声: 「最も熱意を感じさせる投稿はどれですか」
動画: 「回答者は3番目の質問に答える時どのように見えましたか」
翻訳
音声: 「翻訳は同じ感情を伝えていますか」
動画: 「画面に表示されているテキストで、まだ翻訳が必要な部分はありますか」
API
音声: 「話者ごとにトーンとエネルギーをフィールドとして返してください」
動画: 「タイムスタンプごとに画面上のテキストと表現を抽出してください」
すべてのカテゴリーは言葉で止まります
ノート取得ツール、インサイトリポジトリ、営業インテリジェンス、リサーチツール、AIアシスタントも同じことをしています。すべて録音をテキストに変換してからテキストを分析します。各ツールはここで止まります。
学術的コーディング
トランスクリプトを手動またはルールに基づいてコード化しますが、話し方と画面内容は分析に含まれません。
インサイトリポジトリ
トランスクリプトテキストを保存とタグ付けしますが、トーンとカメラ上での反応はリポジトリに含まれません。
営業インテリジェンス
言葉からのみセンチメントを読み取るため、回答前の躊躇を聞き取ることができません。
会議
トランスクリプトをノートと要約に変換します。音声は分析されず、画面共有された内容は見えなくなります。
AI調査
インタビューを実施してから、そのテキストだけを分析します。
調査・顧客体験
人々が入力または発話した言葉で評点を付けます。その言葉をどのように発音したかは評価しません。
LLM DIY
貼り付けたトランスクリプトを取得しますが、オーディオとビデオはワークフローに含まれません。
Speak AIはオーディオ、ビデオ、トランスクリプトを同じプラットフォーム上で一緒に分析します。チームがすでに利用しているプラットフォームです。
1つのハブ、3つのモダリティ、そしてそれらに基づいて構築されたツール。
マルチモーダルAIは総称です。各要素の詳細については以下をご覧ください。
Audio analysis
会議から電話インタビューまで、オーディオトラックを含むすべての録音全体のトーン、感情、エネルギー検出。
ビデオ分析
ビデオを含むあらゆる録音から抽出した、ボディランゲージ、顔の表情、画面共有コンテンツ。
テキスト分析
すべてのSpeak AIトランスクリプトの基盤となる分析レイヤー。テーマ、センチメント、キーワード、構造。
コールスコアリング
A concrete application of multimodal analysis: score sales and support calls on tone and content together, not transcript keywords alone. This is the analysis layer behind our sales acceleration platform.
MCP
Speak AIのオーディオ、ビデオ、テキスト分析をModel Context Protocolに対応した既存のAIアシスタントに取り込みます。
価格
マルチモーダル分析がSpeak AIプランにどのように適合するかをご確認ください。展開が進むにつれて更新されます。
マルチモーダル分析へのアクセスを取得します。
マルチモーダル分析はワークスペースごとに有効化され、全員に一括で有効化されるものではありません。通話をご予約いただければ、お客様のワークスペースで有効化し、セットアップを行い、チームがテストできるようにクレジットを追加します。トランスクリプトだけでなく、完全な録音を分析する最初のチームの仲間になりましょう。
よくある質問
マルチモーダルAIについてのよくある質問と、Speak AI内での動作方法。
マルチモーダルAIは、音声、動画、テキストなど複数のタイプの入力を同時に処理・推論できるAIシステムを指します。各入力を個別に処理するのではなく、同時に処理します。Speak AIでは、マルチモーダルAIは、音声、映像、テキストが一緒に分析されることを意味し、最初にトランスクリプトに削減されるのではなく、分析されます。
はい。Speak AIの音声分析は、録音から直接トーン、感情、エネルギーを読み取るため、会議でエネルギーがどこで低下したか、または会話の特定の瞬間の後に誰かのトーンがどのように変わったかなど、質問することができます。
はい。Speak AIの映像分析は、ビデオを含む任意の録音から画面共有コンテンツ、ボディランゲージ、顔の表情を抽出するため、通話の特定の時点で画面に何があったかを質問することができます。
当チームとの通話をご予約ください。マルチモーダル分析はワークスペースごとに有効化され、全員に一括で有効化されるものではありません。セルフサービスのトグルではなく、お客様のワークスペースで有効化し、セットアップを行い、チームがテストできるようにクレジットを追加します。
はい。マルチモーダル分析は、既にSpeak AIにアップロードした録音に機能し、今後の新しいアップロードのみに機能するわけではありません。
Speak AIは幅広い言語をサポートしており、マルチモーダル分析の対応状況は言語によって異なります。通話の際に、お客様の言語の対応状況をご確認させていただきます。
トランスクリプトのみのツールは、録音をテキストに変換し、テキストを分析します。Speak AIは録音自体を分析し、トーン、エネルギー、顔の表情、画面コンテンツを言葉と一緒に組み込むため、何かがどのように言われたか、または示されたかについての質問に答えがあり、何が言われたかだけではなく。
はい。マルチモーダル分析は、Speak AIが既にサポートしている録音タイプ全体に適用されます。これには、会議、インタビュー、電話、調査、レコーダー送信、翻訳録音が含まれます。