自社プロジェクト・開発中

Perfect Studio

最新世代の生成AIモデルを使い、ひとつのアイデアから歌詞・ボーカル・伴奏を備えた完全な楽曲を生成するクロスプラットフォームアプリです。これもクライアントワークではなく、私たち自身のプロジェクトです。

3
プラットフォーム:Android、iOS、Web、単一のコードベース
フェーズ 4/8
収益化、進行中
12
翻訳済みのローンチ言語
未発表
発売日

Perfect Studioとは

Perfect Studioは、アイデア・スタイル・あるいは自分で書いた歌詞をもとに、各ユーザーが選んだ言語で、歌詞・ボーカル・伴奏を備えた完全な楽曲を生成します。ジャンルやムードを選んだり、インストゥルメンタル版を生成したり、特定のセクションだけを再生成したり、楽曲をトラック(ボーカル、ドラム、ベース、メロディ)に分離したり、延長したりできます。ビジネスモデルはフリーミアムで、検証済みの広告と引き換えに数曲を無料で、さらに多く求めるユーザー向けに複数の課金プランを用意しています。

内部はどのように構築されているのか?

クライアント——Android、iPhone/iPad、ブラウザ向けの単一のコードベース——は、いかなるAIモデルとも直接やり取りすることはなく、自身のアクセスキーも一切持ちません。それはまさに、このサイトが当初から避け続けてきた種類の認証情報漏洩そのものだからです。すべてのリクエストは、まず軽量なオーケストレーターを経由し、本人確認、契約状況、月間利用枠、視聴済み広告を確認してから初めてタスクを受け入れ、そこでようやくキューに入れられます。

そのキューの上に私たちが構築した設計こそが、実際のコスト差を生み出しているものです。世界の各リージョンにはそれぞれ独自のジョブキューと、自動的にスケールするマシン群があります——生成すべき楽曲があればゼロから複数インスタンスへとスケールアウトし、仕事がなくなれば数分後にはゼロへと戻ります。あるリージョンでしばらく誰も楽曲をリクエストしなければ、そのリージョンのコストはゼロです。これは私たち自身のアーキテクチャであり、ジョブキューとオートスケーリングするインスタンスグループを提供するどのクラウドプロバイダーにも移植可能で、特定の一社に依存するものではありません。

現在どのフェーズにあるか

プロジェクトは計画された8つのフェーズで進み、現在4つが完了しています。単にデプロイしただけでなく、実データで端から端まで検証済みです。実在のユーザーが登録すると口座が自動生成され、楽曲生成を依頼すると、システムが割当と残高を確認し、ジョブが実際にそのユーザーの地域のキューに届き、再生可能な音声ファイルとなって返ってきます。アプリはすでに Android とブラウザでビルドして動作します(iOS はまだ手元にない機材が必要です)。リリース時の12言語はすべて翻訳済みで、スペイン語と英語を除く10言語はネイティブ話者による確認待ちです。

楽曲生成のフェーズは完了しました。歌詞から音楽までの全工程が端から端まで動作し、体裁の整ったURLではなく実際に再生できる音声を返します。波形表示とタップでのシーク送りを備えたプレーヤーも、その実音声で検証済みです。現在は収益化フェーズです。欧州では広告コードを読み込む前に必ず事前同意を取得し、複数のネットワーク間でメディエーションを行い、オファーウォールでは報酬の一件ごとに暗号署名を付けて日次で突合し、サブスクリプションは常にサーバー側で、署名付きかつ冪等なウェブフックによって検証します。クライアント側では決して検証しません。これらはすべて自前の管理画面から個別に有効化・無効化できます。

このフェーズを完了と判断する前に、とりわけ課金の経路に注意を払いながら、端から端までのバグ監査を実施しました。24件の指摘のうち23件を修正し、それぞれに自動テストを付けました。1件は経過観察中で、未対応のものはありません。最も深刻だったのは、楽曲を生成する処理が冪等でなかったことです。ジョブ完了後にキューのメッセージが再配信されると処理が再実行され、音声が壊れたうえ二重に課金されていました。残るフェーズは4つ——セキュリティの強化、管理画面、ソーシャル機能、そしてローンチです。現在の足止めはコードではありません。アプリは署名もパッケージングも済んでおり、あとは公開と、アカウントおよびストア側の手続きです。いずれも公表した日付はありません。

すでに実現していること

シミュレーションではなく、実データで最初から最後まで検証済みの実際のアカウントとプロフィール
あらゆるジョブを受け入れる前の、実際の利用枠・広告クレジット・サブスクリプション検証
独自のデプロイアーキテクチャ:リージョンごとのジョブキューと、何もすることがないときにゼロコストへスケールダウンする計算リソース
歌詞と楽曲の生成一式。実際に再生できる音声を返すところまで端から端まで検証済み
視覚的な波形とタップでのシーク機能を備え、実際の音声で検証済みの本物のプレーヤー
デバイスの言語を自動検出する、完成済みの12のローンチ言語
これほど詳しく語っている自社プロジェクトはもうひとつあります——それ以外は今のところ厳重に秘密にしています。
← Gabriel Díaz Bernalに戻る