home/categories/media/benchflow-ai-skillsbench-tasks-speaker-diarization-subtitles-environment-skills-multimodal-fusion-skill-md

mediacontent-media

multimodal-fusion-for-speaker-diarization

Name: multimodal-fusion-for-speaker-diarization
Author: benchflow-ai

Combine visual features (face detection, lip movement analysis) with audio features to improve speaker diarization accuracy in video files. Use OpenCV for face detection and lip movement tracking, then fuse visual cues with audio-based speaker embeddings. Essential when processing video files with multiple visible speakers or when audio-only diarization needs visual validation.

소스 보기 media

maintainer

benchflow-ai

업데이트됨 1/23/2026

스타

946

포크

244

quick start

Installation and usage

설치

$ install --globalskills.sh

사용법

설치 후 터미널에서 다음 명령을 실행하여 이 스킬을 사용할 수 있습니다:

skills use multimodal-fusion-for-speaker-diarization