Speak AI의 멀티모달 AI

음성, 시각 정보, 그리고 모든 녹음의 단어를 분석하세요.

You can now analyze tone and visuals in Speak AI, not just words. Audio analysis reads tone, emotion, energy, and more. Visual analysis reads body language, screen sharing content, facial expressions, and more. Multimodal analysis is the engine behind AI-native sales acceleration: the words, the voice, and the visuals, scored together.

★★★★★ G2 4.9점 300,000+ teams 2018년부터
clientname.speakai.co
라이브 00:42
비디오 통화 중 참여자 발언 Sarah K.
비디오 통화 중 참여자 청취 Jordan T.
00:13 / 07:08
SK
Sarah K. 00:42
Speak AI 이전에 다른 도구 세 가지를 시도했습니다. 어느 것도 지속되지 않았습니다.
JT
Jordan T. 01:22
수동 검토 시간. 인터뷰당 6시간, 매번.톤: 답답함 · 에너지: 상승
세 가지 양식, 하나의 플랫폼

한 곳에서 오디오, 비디오, 트랜스크립트를 분석하세요.

통화와 비디오를 반복해서 듣고 보면서 트랜스크립트가 포착하지 못한 순간을 찾는 데 수 시간이 소요됩니다. 이것이 트랜스크립트 전용의 맹점입니다. 통찰력은 누군가의 톤이나 공유된 화면에 계속 있었습니다. Speak AI는 오디오, 비디오, 텍스트를 한 곳에서 분석하므로 단어 밖의 것은 잃어버리지 않습니다.

Transcript

Transcript analysis

모든 트랜스크립트는 주제, 감정, 키워드, 구조에 대해 분석됩니다. Speak AI를 항상 지탱해온 계층이 이제 단독으로 존재하는 대신 오디오 및 비디오 분석과 함께 작동합니다.

오디오

Audio analysis

톤, 감정, 에너지 등을 분석하세요. Speak AI는 무엇을 말했는지뿐 아니라 회의, 인터뷰, 전화 통화, 업로드한 모든 녹음에서 어떻게 말했는지를 듣습니다.

동영상

비디오 분석

바디 랭귀지, 화면 공유 콘텐츠, 얼굴 표정 등을 추출하세요. 녹음에 비디오가 있으면 Speak AI는 오디오 트랙뿐 아니라 카메라와 화면에서 일어난 일을 읽습니다.

통합된 기능, 별도 추가가 아님

멀티모달 분석이 Speak AI 내에서 어떻게 작동하는지

이것은 전환할 수 있는 별도의 도구가 아닙니다. 이미 사용하고 있는 플랫폼에 통합적으로 내장되어 있습니다.

1

녹음

이미 하던 대로 비디오, 오디오 또는 텍스트를 업로드하거나 녹음하세요.

2

Speak AI가 함께 읽음

음성, 영상, 단어를 3가지 별도 도구가 아닌 한 번의 패스로 함께 분석합니다.

3

어디서나 사용

동일한 분석이 AI 채팅, 자동화, 필드, 대시보드, 미팅 어시스턴트 등 이미 작업하는 모든 곳에 나타납니다.

AI 채팅
에너지가 떨어진 지점은 어디이고, 그때 화면에는 무엇이 있었나요?
에너지는 14:32에 떨어졌고, 바로 그때 가격 슬라이드가 화면에 나타났습니다.
오토메이션
트리거새 녹음 분석됨
조건임계값 이하 점수, 톤 불만족
작업팀에 알리고 대시보드 업데이트
회의 도우미
결합예약된 회의
녹음통화의 오디오 및 비디오
Then멀티모달 분석이 자동으로 실행됨
실제 작동 방식 확인

오디오와 비디오가 분석의 일부가 되면 할 수 있는 질문

Speak AI 내부의 실제 프롬프트 쌍입니다. 각 사용 사례에는 오디오 질문과 비디오 질문이 있습니다. 두 양식은 서로 다른 것을 표면화하기 때문입니다.

회의

회의

오디오: 「이 회의에서 에너지가 떨어진 지점은 어디인가요?」

비디오: 「공유 화면에 있던 내용 중 우리가 결정을 내렸을 때가 어디였어?」

인터뷰

인터뷰

오디오: 「이 참여자가 주저했던 부분은 어디야?」

비디오: 「내가 가격에 대해 물었을 때 그들의 표정이 어떻게 변했어?」

전화 통화

전화 통화

오디오: 「가격 이야기가 나온 후 그들의 톤이 어떻게 바뀌었어?」

비디오: 「그들이 이의를 제기했을 때 화면에 뭐가 있었어?」

설문조사

설문조사

오디오: 「어떤 답변들이 중립적이 아니라 불만스러워 들려?」

비디오: 「응답자들이 카메라에 보여준 것 중에 텍스트가 놓친 게 뭐야?」

레코더

레코더

오디오: 「어떤 제출물들이 가장 열정적으로 들려?」

비디오: 「응답자들이 세 번째 질문에 답할 때 어떻게 보였어?」

번역

번역

오디오: 「번역본이 같은 감정을 담고 있어?」

비디오: 「화면에 있는 텍스트 중에 아직 번역해야 할 게 뭐야?」

API

API

오디오: 「화자별로 톤과 에너지를 필드로 반환해.」

비디오: 「타임스탬프별로 화면 텍스트와 표정을 추출해.」

트랜스크립트를 넘어서

모든 카테고리는 단어에서 멈춘다.

노트 작성 도구, 인사이트 저장소, 영업 인텔리전스, 연구 도구, 심지어 AI 어시스턴트까지 모두 같은 일을 한다. 녹음을 텍스트로 바꾼 다음 텍스트를 분석한다. 각각은 여기서 멈춘다.

학술 코딩

손으로 또는 규칙에 따라 트랜스크립트를 코딩하지만, 전달 방식과 화면은 분석에 포함되지 않는다.

인사이트 저장소

트랜스크립트 텍스트를 저장하고 태그하지만, 톤과 카메라에 비친 반응은 저장소에 포함되지 않는다.

판매 인텔리전스

단어만으로 감정을 읽으므로 답변 전의 주저함을 들을 수 없다.

회의

트랜스크립트를 노트와 요약으로 바꾼다. 음성은 분석되지 않으며, 화면에 공유된 것은 보이지 않는다.

AI 조정 연구

인터뷰를 진행한 다음 그 텍스트만 분석한다.

설문조사 / CX

사람들이 입력하거나 말한 단어로 점수를 매기지만, 그들이 어떻게 말했는지는 분석하지 않는다.

LLM DIY

붙여넣은 트랜스크립트를 받지만, 오디오와 비디오는 이를 둘러싼 워크플로우에 포함되지 않는다.

Speak AI는 오디오, 비디오, 트랜스크립트를 함께 분석하며, 팀이 이미 사용 중인 플랫폼에서 이 모든 것을 처리한다.

더 깊이 있게

하나의 허브, 세 가지 모달리티, 그리고 그것들을 기반으로 구축된 도구들.

멀티모달 AI가 우산 개념이다. 각 부분을 더 깊이 있게 살펴볼 수 있는 곳들이 여기다.

Audio analysis

회의부터 전화 통화, 인터뷰까지 오디오 트랙이 있는 모든 녹음에서의 톤, 감정, 에너지 감지.

비디오 분석

비디오가 포함된 모든 녹음에서 추출되는 신체 언어, 얼굴 표정, 화면 공유 콘텐츠.

텍스트 분석

모든 Speak AI 트랜스크립트 아래의 분석 계층. 테마, 감정, 키워드, 구조.

콜 스코어링

A concrete application of multimodal analysis: score sales and support calls on tone and content together, not transcript keywords alone. This is the analysis layer behind our sales acceleration platform.

MCP

Model Context Protocol을 지원하는 이미 사용 중인 AI 어시스턴트에 Speak AI의 오디오, 비디오, 텍스트 분석을 가져온다.

가격 책정

멀티모달 분석이 출시되면서 Speak AI 요금제에 어떻게 적용되는지 확인해보자.

우선 액세스

멀티모달 분석에 접근할 수 있습니다.

멀티모달 분석은 워크스페이스별로 활성화되며, 모든 사용자에게 한 번에 켜지지 않습니다. 통화를 예약하면 당신의 워크스페이스에 켜고, 함께 설정하고, 팀이 테스트할 수 있도록 크레딧을 추가합니다. 전사본만이 아니라 전체 녹음을 분석하는 선도 팀 중 하나가 되세요.

자주 묻는 질문

멀티모달 AI와 Speak AI 내에서의 작동 방식에 대한 자주 묻는 질문.

멀티모달 AI는 오디오, 비디오, 텍스트와 같은 둘 이상의 입력 유형을 각각 따로 처리하는 대신 동시에 처리하고 추론할 수 있는 AI 시스템을 말합니다. Speak AI에서 멀티모달 AI는 녹음을 먼저 전사본으로 축약하는 대신 녹음의 음성, 화면, 말이 모두 함께 분석된다는 의미입니다.

네. Speak AI의 오디오 분석은 녹음에서 직접 톤, 감정, 에너지를 읽으므로, 회의에서 에너지가 떨어진 지점이나 대화의 특정 시점 이후 누군가의 톤이 어떻게 변했는지 물어볼 수 있습니다.

네. Speak AI의 시각 분석은 비디오가 포함된 모든 녹음에서 화면 공유 콘텐츠, 신체 언어, 얼굴 표정을 추출하므로, 통화의 특정 시점에 화면에 무엇이 있었는지 물어볼 수 있습니다.

당사 팀과 통화를 예약하세요. 멀티모달 분석은 워크스페이스별로 활성화되며, 모든 사용자에게 한 번에 켜지지 않습니다. 셀프 서비스 토글이 아니라, 당신의 워크스페이스에 켜고, 함께 설정하고, 팀이 테스트할 수 있도록 크레딧을 추가합니다.

네. 멀티모달 분석은 향후 새 업로드뿐만 아니라 이미 Speak AI에 업로드한 녹음에서도 작동합니다.

Speak AI는 광범위한 언어를 지원하며, 멀티모달 분석 지원은 언어별로 다릅니다. 통화에서 당신의 언어에 대한 지원을 확인해드립니다.

전사본만 제공하는 도구는 녹음을 텍스트로 변환하고 텍스트를 분석합니다. Speak AI는 녹음 자체를 분석하여 톤, 에너지, 얼굴 표정, 화면 콘텐츠를 말과 함께 보관하므로, 무엇이 어떻게 말해지거나 표시되었는지에 대한 질문에 답변을 얻을 수 있으며, 단순히 무엇이 말해졌는지만이 아닙니다.

네. 멀티모달 분석은 회의, 인터뷰, 전화 통화, 설문조사, 녹음 제출, 번역된 녹음을 포함하여 Speak AI가 이미 지원하는 녹음 유형 전체에 적용됩니다.

당신의 녹음이 통찰력을 담고 있습니다. 이를 얻으세요.

하나의 플랫폼에서 오디오, 비디오, 전사본 분석. 통화를 예약하여 당신의 워크스페이스에 대한 첫 접근과 전문 설정을 받으세요.

의무 사항 없음. 가격 보기

Book your free consult

Pick a time below. We turn audio and video analysis on for your workspace, add credits so your first runs are on us, and set up your first analysis with you.