구글의 인상적인 새로운 인공지능 시스템은 텍스트 설명이 주어진 어떤 장르의 음악을 생성할 수 있습니다. 하지만 구글은 위험을 두려워하여 그것을 출시할 즉각적인 계획은 없습니다.
MusicLM이라고 불리는 구글은 확실히 노래를 위한 최초의 인공지능 시스템이 아닙니다. 음악을 시각화해 작곡하는 AI인 리퓨전을 비롯해 구글 자체 오디오ML, 오픈 등 다른 시도도 있었습니다. 그러나 기술적인 한계와 제한된 훈련 데이터 때문에 어느 누구도 작곡이나 충실도가 높은 노래를 특별히 제작할 수 없었습니다.

MusicLM은 아마도 첫 번째로 이것을 가능하게 할 AI입니다.
학술 논문에 자세히 수록된 MusicLM은 창작자들의 말처럼 "상당한 복잡성"(예: "기억에 남는 색소폰 솔로와 솔로 가수로 매혹적인 재즈 노래" 또는 "낮은 베이스와 강한 킥을 가진 베를린 90년대 테크노")에 대한 설명을 위해 일관된 노래를 생성하는 방법을 배우기 위해 280,000시간의 음악 데이터 세트에 대해 교육을 받았습니다. 그 결과물들은 놀랍게도, 인간 예술가가 작곡할 수 있는 것처럼 들립니다.
루프에 음악가나 악기 연주자가 없다는 것을 고려할 때 샘플이 얼마나 좋은 소리를 내는지 과장하기는 어렵습니다. MusicLM은 다소 길고 구불구불한 설명을 들을 때에도 악기 리프, 멜로디, 분위기와 같은 뉘앙스를 포착할 수 있습니다.
예를 들어, 아래 샘플에 대한 캡션에는 "우주에서 길을 잃은 경험을 유도한다"는 비트가 포함되어 있으며, 그 전면(적으로 내 귀에)을 확실히 전달합니다:
여기 "아케이드 게임의 메인 사운드 트랙"이라는 문장으로 시작하는 설명에서 생성된 또 다른 샘플이 있습니다 그럴듯하죠?
MusicLM의 기능은 노래의 짧은 클립을 생성하는 것 이상으로 확장됩니다. 구글 연구원들은 이 시스템이 흥얼거림, 노래, 휘파람 또는 악기로 연주하는 기존의 멜로디를 기반으로 할 수 있다는 것을 보여줍니다. 게다가, MusicLM은 "명상하는 시간", "깨어나는 시간", "달리는 시간", "100%를 주는 시간"과 같은 순서로 쓰인 몇 가지 설명을 취할 수 있으며, 최대 몇 분의 길이에 이르는 멜로딕한 "이야기" 또는 이야기를 만들 수 있습니다. 이는 영화 사운드 트랙에 완벽하게 적합합니다.
"비디오 게임에서 연주되는 전자 노래", "강 옆에서 연주되는 명상 노래", "불꽃", "불꽃" 순서에서 나온 아래를 보세요
그것이 전부가 아녜요. 사진과 캡션의 조합을 통해 음악 LM을 지시하거나 특정 장르의 특정 유형의 계측기에서 "재생"되는 오디오를 생성할 수도 있습니다. 인공지능 "음악가"의 경험 수준도 설정할 수 있으며, 시스템은 장소, 시대 또는 요구 사항에서 영감을 받은 음악(예: 운동에 대한 동기 부여 음악)을 만들 수 있습니다.
하지만 MusicLM은 확실히 흠잡을 데가 없는 것은 아닙니다. 사실, 그것과는 거리가 멀죠. 샘플 중 일부는 교육 과정의 불가피한 부작용인 왜곡된 품질을 가지고 있습니다. 그리고 MusicLM은 기술적으로 합창 하모니를 포함한 보컬을 생성할 수 있지만, 아쉬운 점이 많습니다. 대부분의 "가사"는 몇몇 예술가들의 혼합처럼 들리는 합성된 목소리에 의해 노래되는 겨우 영어에서 순수한 횡설수설에 이르기까지 다양합니다.
그럼에도 불구하고, Google 연구원들은 MusicLM과 같은 시스템이 제기하는 많은 윤리적 문제에 주목합니다. 여기에는 교육 데이터의 저작권이 있는 자료를 생성된 노래에 통합하는 경향이 포함됩니다. 실험 중에, 그들은 시스템이 생성한 음악의 약 1%가 훈련한 노래에서 직접 복제된다는 것을 발견했습니다. 이 임계값은 현재 상태에서 MusicLM을 출시하는 것을 단념시킬 만큼 충분히 높습니다.
논문의 공동 저자들은 "우리는 사용 사례와 관련된 창의적인 콘텐츠의 잠재적인 유용 위험성을 인정합니다."라고 썼습니다. "우리는 음악 생성과 관련된 이러한 위험을 해결하기 위해 더 많은 미래 작업의 필요성을 강력히 강조합니다."
MusicLM이나 이와 같은 시스템을 언젠가는 사용할 수 있게 될 것이라고 가정할 때, 시스템이 아티스트를 대체하는 것이 아니라 아티스트를 지원하는 도구로 자리매김하더라도 주요 법적 문제가 표면화될 것이 불가피해 보입니다. 그들은 이미 더 간단한 AI 시스템을 가지고 있습니다. 2020년, 제이지의 음반사는 빌리 조엘의 "We Don't Start the Fire"와 같은 노래의 제이지 커버를 만들기 위해 AI를 사용했다는 이유로 유튜브 채널인 보컬 신시사이징을 저작권 파업을 제기했습니다 처음에 비디오를 제거한 후, YouTube는 비디오를 복구했으며, 테이크다운 요청이 "미완성"이었다는 것을 발견했습니다 하지만 딥페이크 음악은 여전히 모호한 법적 근거 위에 서 있습니다.
현재 음악 출판업자 협회의 법률 인턴인 Eric Sunray가 작성한 백서는 MusicLM과 같은 AI 음악 생성기가 "훈련에서 섭취하는 작품에서 일관된 오디오의 태피스트리를 만들어 음악 저작권을 침해하고, 그에 따라 미국 저작권법의 복제권을 침해한다"고 주장합니다 주크박스 출시 이후 비평가들은 저작권이 있는 음악 자료에 대한 AI 모델 훈련이 공정한 사용에 해당하는지에 대해서도 의문을 제기했습니다.

