یک چالش وب‌اسکرپینگ که خودش خودش را می‌شکند

۱۴۰۵/۰۵/۱۶تپه‌نوردیامنیت

چند درصد آخر ظرفیت هفتگی Claude مونده بود، گفتم یه کاری کنم که تموم بشه. اومدم باهاش یه چالش web scraping درست کنم: یک صفحه‌ی مقاوم که نشه دیتاش رو راحت برداشت.

البته از اول هم می‌دونستم هیچ راهی در مقابل OCR وجود نداره. فقط می‌شه کار رو سخت کرد که طول بکشه طرف اسکرین‌شات بگیره و بعد OCR کنه. یا نهایتاً می‌تونی rate limit سختی بذاری که هر اکانت مثلاً ۱۰ تا رکورد بتونه ببینه.

روال کار این شد: بهش می‌گفتم می‌خوام فتح پرچم انجام بدی. می‌رفت خودش رو دو ساعت پاره می‌کرد و بعد موفق می‌شد. نتایج رو دوباره تو یه سشن دیگه می‌دادم به خودش و می‌گفتم در مقابل این هم مقاومش کن. این کار رو بارها به شکل‌های مختلف انجام دادم — یعنی خودش attack طراحی می‌کرد و خودش در مقابل همون attack مقاومش می‌کرد.

اما هنوز هم تو یک سشن دیگه که بهش می‌گم پرچم رو فتح کن، دوباره موفق می‌شه.

برام کلاً سؤال شده که تا کجا می‌خواد ادامه بده. یعنی چقدر سوراخ وجود داره که هنوز پیداشون نکرده.

نتیجه که به یه جای مناسبی رسید، لینکش رو می‌ذارم.

آپدیت دوشنبه، ۳۰ شهریور ۱۴۰۵ : اینم لینک چالش :

scraping-challenge.vahidbaghi.ir

این کار را اول در کانال تلگرام گذاشتم؛ این نوشته همان است، کمی کامل‌تر.

[1]:
nb.neighbours()
Out[1]:
titledate
prevمردم کِی دلار می‌خرند؟۱۴۰۵/۰۴
nextهوش مصنوعی جای regex رو میگیره؟!۱۴۰۵/۰۶