[15:23:27] === Mac voice-extract: idol=winter, urls=3 === [15:23:27] root: /Users/inhohur/ai/experiments/voice-extract-mac/winter/data [15:23:27] device: mps [15:23:27] [1/7] fetch [15:23:27] fetch [yt-dlp] de6FhGIFoxA ... [15:23:41] done (5564s, 14.1s elapsed) [15:23:41] fetch [yt-dlp] OrFTzGP57MQ ... [15:23:56] done (4222s, 14.8s elapsed) [15:23:56] fetch [yt-dlp] yOIZ53fviVk ... [15:24:03] done (2483s, 7.0s elapsed) [15:24:03] [2/7] vocals (demucs-mlx) [15:24:03] vocals [demucs-mlx] batch separating 3 track(s) ... [15:33:48] batch done (584.2s elapsed) [15:33:50] [de6FhGIFoxA] -> de6FhGIFoxA.wav [15:33:51] [OrFTzGP57MQ] -> OrFTzGP57MQ.wav [15:33:52] [yOIZ53fviVk] -> yOIZ53fviVk.wav [15:33:52] [3/7] diarize (pyannote 3.1 / MPS) [15:33:57] diarize [pyannote] loading speaker-diarization-3.1 on mps ... [15:33:58] loaded (1.7s) [15:33:58] diarize [run] de6FhGIFoxA ... [15:38:24] done (265.8s) — 1430 segments, 4 speakers: ['SPEAKER_00', 'SPEAKER_01', 'SPEAKER_02', 'SPEAKER_03'] [15:38:24] diarize [run] OrFTzGP57MQ ... [15:44:45] done (380.3s) — 1100 segments, 3 speakers: ['SPEAKER_00', 'SPEAKER_01', 'SPEAKER_02'] [15:44:45] diarize [run] yOIZ53fviVk ... [15:46:40] done (115.0s) — 548 segments, 2 speakers: ['SPEAKER_00', 'SPEAKER_01'] [15:46:40] [4/7] select [15:46:40] select auto_dominant: SPEAKER_01 (total 1627.0s) [15:46:40] SPEAKER_01: 1627.0s [15:46:40] SPEAKER_00: 122.9s [15:46:40] SPEAKER_02: 45.8s [15:46:40] SPEAKER_03: 25.3s [15:46:40] [5/7] match (WeSpeaker ResNet34 / MPS) [15:46:40] match [load WeSpeaker] on mps ... [15:46:41] loaded (1.5s) [15:46:41] match [centroid] from de6FhGIFoxA SPEAKER_01 ... [15:46:58] centroid: 648 segments [15:47:05] match [de6FhGIFoxA] 497/1430 segments ≥ 0.55 (6.9s) [15:47:14] match [OrFTzGP57MQ] 343/1100 segments ≥ 0.55 (8.7s) [15:47:18] match [yOIZ53fviVk] 194/548 segments ≥ 0.55 (3.5s) [15:47:18] matched total: 1034 [15:47:18] [6/7] filter [15:47:18] filter [silero-vad] loading ... [15:47:25] filter kept: 402 segments [15:47:25] [7/7] concat + transcribe [15:47:25] concat prompt.wav: 29.23s (7 chunks) [15:47:25] transcribe [docksvc whisper] prompt.wav ... [15:47:29] done (4.4s) — 210 chars [15:47:29] "와 학교 다닐 때 빼빼로 교환했었는데 막 친구들이랑 공연할 때는 긴 머리 좋아하고 근데 나는 개인적으로 나는 나는 지금 손톱도 많이 자라서 나 네일 하러 가야 되는데 무조건 채워야 되는 모두가 이제 모두가? 아니 노래를 정해야 되는데 하고 싶은 노래가 너무 많아가지고 지금 그냥 끊는 게 아니고 뭔가 일단 각도도 있었고 학교 다닐 때 봉사 시간을 채워야 했단 말이에요 그 무슨" [15:47:29] === done === [15:47:29] dataset_dir: /Users/inhohur/ai/experiments/voice-extract-mac/winter/data/filtered [15:47:29] prompt.wav: /Users/inhohur/ai/experiments/voice-extract-mac/winter/data/prompt.wav [15:47:29] prompt.txt: /Users/inhohur/ai/experiments/voice-extract-mac/winter/data/prompt.txt [15:47:29] manifest: /Users/inhohur/ai/experiments/voice-extract-mac/winter/data/manifest.json