Deteksi tulisan AI lewat satu kata khas atau tanda baca sering menyesatkan. Jochen Madler melaporkan replikasi eksperimen blog korporat di LinkedIn. Classifier-nya membaca 214 sinyal struktural, bukan leksikon. Pada dataset tertutup, hasil uji: 19 salah dari 1.740 posting.
Namun angka itu bukan sertifikat bahwa semua detektor online 98% benar. Bukan pula bukti forensik siapa menulis draft Anda. Tetap, studi ini memberi bahasa teknis untuk tim konten. Jadi pertanyaannya jelas: yang terasa “AI”, kosakata atau cara artikel dirakit?
Highlight
Replikasi blog vs paper fiksi StoryScope
- Sumber: arsip Wayback, 2.000+ posting blog perusahaan (±2009–2020), lalu lima model menulis ulang versi AI.
- Classifier menjawab 214 pertanyaan tentang rakitan teks (sumber klaim, kutipan ahli bernama, intensitas promosi produk, dll.).
- Pada 1.740 sampel uji: ~98% benar memisahkan manusia vs AI; 19 kesalahan—angka spesifik dataset ini.
- Paraphrase berat hampir tidak mengubah skor; sinyal struktur tetap dominan dibanding ganti sinonim.
- Google menilai usefulness dan spam behavior, bukan label “terdeteksi AI” publik—jangan disamakan.
Klaim studi dan siapa yang mengukur

Selanjutnya Promptstacks merangkum eksperimen tech founder yang mereplikasi ide StoryScope (Russell dkk., fiksi naratif) ke posting blog perusahaan. Posting Madler di LinkedIn menjelaskan pipeline singkat. Tim mengumpulkan 2.000+ artikel dari 250+ situs via Wayback Machine. Lima generator—ChatGPT, Claude, Gemini, DeepSeek, Kimi—menulis ulang setiap teks manusia. Model klasifikasi latih pada jawaban 214 pertanyaan tentang cara teks dibangun.
Search Engine Land ikut menyoroti temuan serupa lewat saluran X. Ringkasan newsletter Promptstacks selaras, tetapi angka final kami ancor ke posting Madler. Paper StoryScope asli memakai ±304 fitur naratif pada cerita fiksi panjang. Metriknya berbeda (macro-F1 ~93% untuk human vs AI). Akhirnya, jangan campur angka itu dengan 98% pada blog korporat.
Deteksi tulisan AI: apa yang benar-benar diuji
Jadi populasi bukan “semua tulisan di web”. Ini pasangan paralel. Satu posting manusia historis plus lima versi model pada topik sama. Generator dan prompt sudah tetap sejak awal penelitian. Classifier tidak menilai teks mentah sembar. Kemudian setiap posting menjawab 214 pertanyaan struktural. Sumber menyebut contoh: klaim punya rujukan, kutipan pakar bernama, seberapa agresif teks mempromosikan produk.
Akurasi ~98% artinya, pada 1.740 posting uji yang tidak masuk training, model salah 19 kali. Tetapi denominator itu penting. Bukan “98% dari seluruh internet”, melainkan error rate pada split uji eksperimen ini. Selanjutnya Madler melatih classifier kedua untuk menebak penulis. Akurasi ~79% untuk model AI mana vs manusia, dibanding ~17% tebakan acak. “Aksen” rakitan berbeda antar generator, bukan sekadar pilihan kata.
Struktur artikel vs kosakata yang dituduh AI
Namun debat publik sering terjebak pada petunjuk permukaan. Frasa Inggris tertentu, panjang kalimat, atau tanda baca khas model jadi tersangka. Arena dan vendor model melaporkan penurunan marker lama pada generasi baru. Produsen sengaja melatih model menghindari pola itu. Walau demikian, eksperimen blog di atas mengukur assembly: repetisi intro–body–penutup, distribusi paragraf, kebiasaan list, dan argumen yang punya bukti nyata.
Newsletter Promptstacks menarik implikasi editorial. Menyuruh model “terdengar manusia” tanpa mengubah kerangka argumen hanya menukar permukaan. Saat Anda mengedit draft AI, potong paragraf yang mengulang poin sebelumnya. Tambahkan sumber pada klaim faktual. Sebut nama narasumber. Akhirnya biarkan satu bagian lebih panjang bila butuh depth—bukan sekadar humanizer kosmetik.
Mengapa benchmark tertutup bukan bukti authorship di lapangan
Lantaran classifier hanya sekuat korpus latih, versi model yang pernah dilihat, bahasa, niche, dan seberapa jauh editor mengubah outline. Penulis manusia dengan template SEO ketat bisa berbagi “bentuk” dengan output model. Sebaliknya draft AI yang direstruktur total, difakt-check, atau ditulis ulang dari riset lapangan bisa lolos detektor yang belum pernah melihat pola itu.
High accuracy pada dataset paralel (manusia vs lima rewrite model) tidak otomatis jadi alat hukum atau HR. Tim legal dan HR tetap butuh proses tersendiri. Namun fokus tulisan ini riset interpretasi konten, bukan kebijakan perusahaan Anda.
False positive dan false negative yang sering dilupakan
False positive: penulis manusia dengan SOP konten ketat—outline H2 identik, transisi seragam, CTA di setiap section—bisa terklasifikasi mirip AI meski tulisan asli. Itu risiko etis detektor otomatis di sekolah atau redaksi tanpa banding manusia.
False negative: rewrite paraphrase, campuran manusia+AI, model baru setelah tanggal training, atau niche dengan sedikit data latih. Madler menekankan: meski frasa asli hampir hilang setelah beberapa putaran rewrite model, classifier struktural tetap stabil. Klaim itu berlaku dalam setup mereka saja, bukan bukti universal “humanizer gagal”.
Implikasi SEO, Google, dan kualitas konten
Tetapi Google tidak menerbitkan aturan publik “konten terdeteksi AI = turun ranking”. Kebijakan spam menargetkan scaled content abuse, konten tanpa nilai, manipulasi, dan perilaku mass-production. Bukan label detektor pihak ketiga. Artikel ciri artikel SEO berkualitas rendah relevan: template seragam tanpa bukti sering gagal di mata pembaca meski lulus checker kata.
Search Essentials dan spam policies menekankan usefulness, originality, dan effort. Google tidak menilai apakah draft berawal dari prompt. Jadi obsesi lolos detektor salah arah. Yang lebih aman: fact-check, sumber primer, pengalaman redaksional nyata, struktur yang melayani intent pencarian. Untuk atribusi traffic dan AI search, lihat juga rencana SEO saat traffic dari AI sulit diukur.
Takeaway editorial untuk tim konten dan website
Deteksi tulisan AI pada studi ini bukan daftar kata terlarang. Profilnya: cara artikel membuktikan klaim, variasi ritme, dan menghindari promosi monoton. Tim yang memakai LLM sebagai draft engine tetap bisa publish bermartabat. Outline, riset, dan editing manusia harus mengubah skeleton, bukan hanya sinonim.
Jangan jual janji “98% deteksi” ke klien atau atasan sebagai standar industri. Selanjutnya pakai temuan untuk audit internal: blog berulang tanpa sumber, section dengan panjang identik, atau CTA dominan tanpa konteks. Akhirnya perbaiki karena pembaca dan kebijakan spam peduli kualitas, bukan karena Anda khawatir satu frasa Inggris tertentu.