Содержание

 

1. Зачем психологу уметь транскрибировать видео

Когда психолог начинает работать с записями – будь то супервизия, терапевтическая сессия или вебинар – он неизбежно оказывается в плену звуков. И чтобы увидеть суть, эти звуки нужно превратить в текст – точный, живой, отражающий интонацию и смысл. Если вам приходилось раньше делать транскрибацию записи — перевода звука в текст, то вы знаете, какая это трудоемкая работа.

Теперь можно использовать Whisper Desktop – бесплатный инструмент от OpenAI, который автоматически превращает речь (из видео или аудио) в текст.

Для психолога это значит:

 

100 % соблюдение профессиональной этике психолога

Whisper работает прямо на вашем локальном устройстве, поэтому все аудио и текстовые данные не покидают ваш компьютер. Это значит, что вы полностью сохраняете конфиденциальность: никакие записи, голоса или транскрипции не отправляются в интернет и не хранятся на внешних серверах.
100 % приватности и соответствие профессиональной этике психолога.

 

Важно!

Для быстрой работы Whisper нужна мощная видеокарта с большим объёмом видеопамяти (VRAM) или хороший многоядерный процессор.

2. Как Whisper понимает речь лучше человека

Whisper – это открытая модель искусственного интеллекта от OpenAI, созданная для распознавания и транскрибации речи. Её выпустили в сентябре 2022 года, и с тех пор она заслужила репутацию одного из самых точных инструментов в своей нише.

Ключевые особенности:

 

Секрет модели — в её обучении. OpenAI использовала 680 000 часов размеченных аудиоданных с YouTube, подкастов, телефонных разговоров и даже радиопередач. Это в 100 раз больше, чем датасеты для предыдущих моделей!

3. Выбор модели автоматического распознования

Whisper – не одна программа, а целое семейство моделей, и каждая из них будто обладает своим характером. Одни – быстрые, но не слишком внимательные, другие – медленные, зато слышат даже шёпот и акцент. Важно выбрать ту, что подойдёт именно вам – под ваш компьютер и под ваши задачи.

Выбор модели


Выбирайте модель под задачи и ресурсы компьютера.

Если важна скорость и лёгкость — подойдёт Tiny/Base.
Если приоритет — точность и глубина распознавания — выбирайте Medium/Large.

Не знаете точных характеристик устройства и не определились с задачами – начните со Small

4. Установка и запуск Whisper Desktop (шаг за шагом)


1. Скачайте архив программы и подходящую модель автоматического распознавания речи

Отдельные модели:

Модели периодически обновляются. Проверяйте актуальность на странице всех моделей.

2. Распакуйте Zip-архив с программой в любую папку


3. В эту же папку скопируйте файл модели.

* Вы можете скачать несколько моделей и все поместить в папку с программой. Позже вы сможете выбирать нужную модель в настройках.


4. Первый запуск

Откройте программу и выберите нужную модель.


5. Загрузите файл для транскрибации, выберите язык распознавания и формат вывода.

Если поставить галочку на Translate, то Whisper переведёт речь на английский язык во время транскрибации.

Output Format (Формат вывода)

Определяет, в каком виде сохранить результат транскрибации. Доступные варианты:

Если стоит галочка Place that file to the input folder – итоговый файл (текст или субтитры) будет сохранён в ту же папку, где находится исходное видео.


6. Чтобы сменить модель распознавания, нажмите кнопку Back – вы вернетесь на гравный экран, где выберите новую модель

7. Режим распознавания аудио в прямой записи

Кнопка Audio Capture позволяет записать звук напрямую с микрофона или системы и сразу транскрибировать его.

Выберите язык, микрофон, укажите название файла и нажмите Capture.

Если отмечен пункт Append to that file, новый текст будет добавляться к существующему файлу (а не перезаписывать его).
Это удобно при длительных записях – весь текст сохраняется в одном документе.




1. Скачайте файл программы с расширением .dmg с официльного сайта:

Releases · PVAS-Development/whisperdesk

или по прямой ссылке — СКАЧАТЬ WhisperDesk-1.8.0-universal.dmg

2. Установите приложение.

3. Первый запуск

Если macOS заблокирует запуск:

4. Установка FFmeg.

WhisperDesk просит установить FFmpeg. Без него транскрибация не запустится.

На Mac это делается через терминал.

Шаг 1. Открыть Терминал

Откроется чёрное окно.

/bin/bash -c «$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)»

Шаг 2. Установить FFmpeg

brew install ffmpeg

Шаг 3. Проверка

ffmpeg -version

Шаг 4. Вернуться в WhisperDesk

1. Скачайте архив программы и подходящую модель автоматического распознавания речи

Отдельные модели:

Модели периодически обновляются. Проверяйте актуальность на странице всех моделей.

2. Распакуйте Zip-архив с программой в любую папку


3. В эту же папку скопируйте файл модели.

* Вы можете скачать несколько моделей и все поместить в папку с программой. Позже вы сможете выбирать нужную модель в настройках.


4. Первый запуск

Откройте программу и выберите нужную модель.


5. Загрузите файл для транскрибации, выберите язык распознавания и формат вывода.

Если поставить галочку на Translate, то Whisper переведёт речь на английский язык во время транскрибации.

Output Format (Формат вывода)

Определяет, в каком виде сохранить результат транскрибации. Доступные варианты:

Если стоит галочка Place that file to the input folder – итоговый файл (текст или субтитры) будет сохранён в ту же папку, где находится исходное видео.


6. Чтобы сменить модель распознавания, нажмите кнопку Back – вы вернетесь на гравный экран, где выберите новую модель

7. Режим распознавания аудио в прямой записи

Кнопка Audio Capture позволяет записать звук напрямую с микрофона или системы и сразу транскрибировать его.

Выберите язык, микрофон, укажите название файла и нажмите Capture.

Если отмечен пункт Append to that file, новый текст будет добавляться к существующему файлу (а не перезаписывать его).
Это удобно при длительных записях – весь текст сохраняется в одном документе.




1. Скачайте файл программы с расширением .dmg с официльного сайта:

Releases · PVAS-Development/whisperdesk

или по прямой ссылке — СКАЧАТЬ WhisperDesk-1.8.0-universal.dmg

2. Установите приложение.

3. Первый запуск

Если macOS заблокирует запуск:

4. Установка FFmeg.

WhisperDesk просит установить FFmpeg. Без него транскрибация не запустится.

На Mac это делается через терминал.

Шаг 1. Открыть Терминал

Откроется чёрное окно.

/bin/bash -c «$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)»

Шаг 2. Установить FFmpeg

brew install ffmpeg

Шаг 3. Проверка

ffmpeg -version

Шаг 4. Вернуться в WhisperDesk