[14:47:18] === Mac voice-extract: idol=heize, urls=3 === [14:47:18] root: /Users/inhohur/ai/experiments/voice-extract-mac/heize/data [14:47:18] device: mps [14:47:18] [1/7] fetch [14:47:18] fetch [yt-dlp] zGtbc5rEMRo ... [14:48:00] done (5345s, 42.1s elapsed) [14:48:00] fetch [yt-dlp] 7Tq0H4Bo1nY ... [14:48:05] done (1543s, 5.3s elapsed) [14:48:05] fetch [yt-dlp] w7_OWXWZHH0 ... [14:48:11] done (775s, 5.9s elapsed) [14:48:11] [2/7] vocals (demucs-mlx) [14:48:11] vocals [demucs-mlx] batch separating 3 track(s) ... [14:50:05] batch done (114.3s elapsed) [14:50:07] [zGtbc5rEMRo] -> zGtbc5rEMRo.wav [14:50:08] [7Tq0H4Bo1nY] -> 7Tq0H4Bo1nY.wav [14:50:08] [w7_OWXWZHH0] -> w7_OWXWZHH0.wav [14:50:08] [3/7] diarize (pyannote 3.1 / MPS) [14:50:13] diarize [pyannote] loading speaker-diarization-3.1 on mps ... [14:50:14] loaded (1.7s) [14:50:14] diarize [run] zGtbc5rEMRo ... [14:54:16] done (241.8s) — 1122 segments, 3 speakers: ['SPEAKER_00', 'SPEAKER_01', 'SPEAKER_02'] [14:54:16] diarize [run] 7Tq0H4Bo1nY ... [14:55:01] done (44.5s) — 409 segments, 6 speakers: ['SPEAKER_00', 'SPEAKER_01', 'SPEAKER_02', 'SPEAKER_03', 'SPEAKER_04', 'SPEAKER_05'] [14:55:01] diarize [run] w7_OWXWZHH0 ... [14:55:20] done (19.2s) — 219 segments, 2 speakers: ['SPEAKER_00', 'SPEAKER_01'] [14:55:20] [4/7] select [14:55:20] select auto_dominant: SPEAKER_00 (total 2731.1s) [14:55:20] SPEAKER_00: 2731.1s [14:55:20] SPEAKER_02: 1024.7s [14:55:20] SPEAKER_01: 34.9s [14:55:20] [5/7] match (WeSpeaker ResNet34 / MPS) [14:55:20] match [load WeSpeaker] on mps ... [14:55:20] loaded (0.3s) [14:55:20] match [centroid] from zGtbc5rEMRo SPEAKER_00 ... [14:56:35] centroid: 713 segments [14:57:09] match [zGtbc5rEMRo] 590/1122 segments ≥ 0.55 (34.3s) [14:57:32] match [7Tq0H4Bo1nY] 0/409 segments ≥ 0.55 (22.4s) [14:57:40] match [w7_OWXWZHH0] 110/219 segments ≥ 0.55 (8.6s) [14:57:40] matched total: 700 [14:57:40] [6/7] filter [14:57:40] filter [silero-vad] loading ... [14:57:49] filter kept: 531 segments [14:57:49] [7/7] concat + transcribe [14:57:49] concat prompt.wav: 29.33s (3 chunks) [14:57:49] transcribe [docksvc whisper] prompt.wav ... [14:57:51] done (1.9s) — 216 chars [14:57:51] "여러분 이 뮤비 풀버전 내일 저녁에 공개되니까요 노래 들으시면서 비디오도 꼭 봐주시고 좋아요도 꾹 눌러주세요 인스타그램으로 천님께서 입술놀애 풀버전 너무 궁금해요 그리고 10센티 권정열 님께 전화해서 정확히 뭐라고 하면서 뺏어온 노래인가요? 대화를 나눠보는 게 좋을 것 같아요 그리고 뭐 지금 헤어지면 남자친구가 힘들까 봐 못 헤어지겠어요 이거는 사실 제가 생각했을 땐 핑계인 것 같아요" [14:57:51] === done === [14:57:51] dataset_dir: /Users/inhohur/ai/experiments/voice-extract-mac/heize/data/filtered [14:57:51] prompt.wav: /Users/inhohur/ai/experiments/voice-extract-mac/heize/data/prompt.wav [14:57:51] prompt.txt: /Users/inhohur/ai/experiments/voice-extract-mac/heize/data/prompt.txt [14:57:51] manifest: /Users/inhohur/ai/experiments/voice-extract-mac/heize/data/manifest.json