Pada 20 Agustus lalu, sebuah model bernama Ox Alpha muncul di OpenRouter tanpa identitas jelas — tanpa nama developer, tanpa press release, tanpa benchmark marketing. Dalam hitungan hari, ia duduk di posisi pertama leaderboard OpenRouter dengan 17,5 triliun token dikonsumsi dalam satu minggu, melampaui DeepSeek. Tidak ada yang tahu siapa yang membuatnya. Spekulasi beredar: Google? Microsoft? Lab China seperti Z.ai?
Tapi bagi investor, pertanyaan itu mungkin tidak sepenting yang terlihat.
Yang benar-benar penting adalah ini: komunitas developer global tidak bisa membedakan apakah model tersebut buatan lab AI terkemuka Amerika atau pemain baru dari China. Dua tahun lalu, itu tidak mungkin terjadi. Sekarang, itu adalah kenyataan yang harus dipricing oleh pasar.
OpenRouter bukan sekadar marketplace. Ia adalah routing layer — infrastruktur yang memungkinkan developer berpindah model secara bebas berdasarkan spesifikasi, latensi, context window, dan cost per outcome. Ketika AT&T melaporkan penghematan 56% pada biaya coding hanya dari model routing, itu bukan anomali. Itu adalah mekanisme commoditisation yang sedang bekerja secara sistematis.
Harga token sudah mencerminkan ini. Capability setara GPT-4 yang dulu dihargai sekitar USD 30 per juta input token di 2023, kini tersedia di kisaran USD 0,10–0,40. Penurunan sekitar 600 kali lipat sejak 2020. Dan belum ada tanda-tanda floor yang terlihat.
Ini menciptakan tekanan serius pada asumsi yang tertanam di balik capex hyperscaler. Empat hyperscaler terbesar saat ini memandu total capital expenditure sekitar USD 725 miliar untuk 2026 — naik ~77% year-on-year — dengan konsensus sudah memproyeksikan lebih dari USD 1 triliun untuk 2027. Asumsi implisitnya: inference akan dijual pada harga yang mengandung economic rent yang cukup untuk mendepresiasi aset selama 5–6 tahun ke depan.
Asumsi itu masih bertahan selama volume tumbuh lebih cepat dari penurunan harga. Sejauh ini, Jevons effect memang nyata — efisiensi mendorong usage yang lebih besar, terutama dari agentic workloads. Tapi risikonya bukan demand hilang. Risikonya adalah unit revenue jatuh lebih cepat dari kenaikan utilisasi, dan marginal token akhirnya dilayani oleh siapa pun yang bersedia menerima return on capital paling rendah — atau bahkan negatif, seperti provider yang saat ini menawarkan Ox Alpha secara gratis.
Free bukan charity. Seseorang membayar untuk inference itu — mereka membeli evaluation data, developer habit, dan opsi untuk reprice di kemudian hari. Persis seperti perilaku pasar dalam perjalanan menuju komoditas penuh.
Lalu di mana value sebenarnya bergerak? Analoginya adalah cloud computing. Raw compute dikommoditisasi selama 15 tahun, harganya turun terus — tapi fortune terbesar justru diraih oleh mereka yang memiliki distribution dan workload, bukan yang menjual compute paling murah. Dalam konteks AI, moat yang relevan kini bergeser ke:
- Distribution dan default placement — siapa yang owns end user
- Proprietary, non-public data
- Ownership of workflow dan system of record — di sinilah switching cost sesungguhnya berada
- Physical scarcity: power, grid connections, high-bandwidth memory, advanced packaging
Application layer adalah beneficiary yang underestimated. Falling inference costs menurunkan biaya untuk embed intelligence ke dalam existing workflows — ini adalah margin tailwind yang kuat bagi software companies. Narasi bahwa AI akan menghancurkan software mungkin justru terbalik: ketika intelligence menjadi abundant dan murah, perusahaan yang paling dekat dengan end user berpotensi capture lebih banyak value, bukan lebih sedikit.
Untuk setiap AI-related holding, ada satu pertanyaan sederhana yang layak diajukan: apakah falling AI cost membuat bisnis ini lebih murah untuk dioperasikan, atau lebih mudah untuk digantikan? Jawaban atas pertanyaan itu menentukan di mana sebenarnya durability of returns berada — bukan di benchmark score, tapi di siapa yang mengontrol distribution, data, dan workflow.