موتور های جستجو

ابراهیم قمی اویلی

مرکز تحقیقات شرکت ایران خودور

e.ghomi@ikco.com

چکیده

      دنیای اینترنت هر روز تعداد مراجعان بیشتری را به سوی خود می کشاند که در این میان وجود موتور های جستجوگرکمک شایانی به کاربران  میکند؛ در این راستا معرفی فعالیت موتور جستجو و مفید بودن آن در عرصه اینترنت که حجم وسیعی از اطلاعات را در بر مییرد خالی از عریضه نیست . این مقاله ضمن معرفی واضح فعالیت موتور جستجو کمکی شایان در خصوص استفاده بهینه و طراحی آن مینماید . اساس کار موتور جستجو با توجه به نام آن جستجو در محیط بزرگ اینترنت و در اختیلر نهادن اطلاعات مورد نیاز کاربران میباشد .

واژه های کلیدی : موتور جستجو ، وب ، پایگاه

1-     مقدمه


       تعداد این موتور های جستجوگر محدود بوده که این  امر موجب شده است تا رقابت بین آ ن ها برای جذب کاربران هر روز شدیدتر شود . با وجود آن که باهو و گوگل کمتر از یک دهه است که فعالیت اصلی شان را بر روی موتورهای موتور های جستجو متمرکز کرده اند، اما سابقه ی موتور های جستجوگر  به حدود 13 سال قبل باز می گردد؛ کمی پس از آن که استفاده ی عمومی از اینترنت در آمریکا  آغاز شد. شیوه ی یافتن صفحات اینترنتی با کلید واژه ها توسط موتور جستجو  ، مبتنی بر جست و جوهای دائمی صفحات وب توسط  نرم افزاری به نام "اسپایدر" است که به وبگردی دائمی  مشغول است؛ اسپایدر همچنین یه روز بودن و ذخیره آن ها را نیز برعهده دارد، در مرحله ی بعدی،  نرم افزار دیگری به نام ”کراولر" درباره ی این که چه صفحاتی را در  سایت موردنظر باید قرار دهد، تصمیم می گیرد . در مرحله ی سوم، صفحات بر مبنای اطلاعات جمع آوری، پردازش و بایگانی  می شوند و سپس این اطلاعات فشرده و در پایگاه داده ها دخیره  می شوند و آخرین مرحله مربوط به ”سیستم رتبه بندی " است و همزمان با تقاضای کاربر، تمام صفحات مرتبط را مشخص و براساس رتبه بندی تنظیم و در کمتر از یک ثانیه آن را ارائه می دهد .

 

 

2-    تعریف موتور جستجو

      موتور جستجو یا جویشگریا جستجوگر به طور عمومی به برنامه‌ای گفته می‌شود که کلمات کلیدی را در یک سند یا بانک اطلاعاتی جستجو می‌کند. در اینترنت به برنامه‌ای گفته می‌شود که کلمات کلیدی موجود در فایلهاو سندهای وب جهانی، گروههای خبری، منوهای گوفر و آرشیوهای FTP را جستجو می‌کند.

3-     انواع جستجوگرها در اینترنت

      موتورهای جستجو به دو دسته کلی تقسيم می‌شوند. موتورهای جستجوی پيمايشی (خودکار) و فهرست‌های تکميل‌دستی (غیر خودکار). البته لازم به ذكر است كه گونه اي جديد از موتورهاي جستجوگر تحت عنوان"ابر جستجوگر-

" (Meta Search Engines) نيز وجود دارد كه در ادامه به توضيح هر يك از اين موارد خواهيم پرداخت:

3-1-موتورهای-جستجوی-پيمايشی
        (Crawler-Based Search Engines) مانند گوگل فهرست خود را بصورت خودکار تشکيل می‌دهند. آنها وب را پيمايش کرده، اطلاعاتی را ذخیره می‌کنند، سپس کاربران از میان این اطلاعات ذخیره شده، آنچه را که می‌خواهند جستجو می‌کنند. اگر شما در صفحه وب خود تغييراتی را اعمال نماييد، موتورهای   جستجوی پيمايشی آنها را به طور خودکار می‌يابند و سپس اين تغييرات در فهرست‌ها اعمال خواهد شد. عنوان، متن و ديگر عناصر صفحه، همگی در این فهرست قرار خواهند گرفت.وجه مشخصه این گروه از جستجوگرها وجود نرم افزار موسوم به SPIDER در آنهاست. این شبه نرم افزار کوچک بصورت خودکار به کاوش در شبکه جهانی


پرداخته و از پایگهای وب یادداشت برداری و فهرست برداری میکند سپس این اطلاعات را برای تجزیه و تحلیل و طبقه بندی به بانک اطلاعاتی موتور جستجوگر تحویل می دهد.

3-2  فهرست‌های دست نویس شده

       فهرست‌های دست نویس شده يا (Human-Powered Directories) مانند فهرست بازی (Open Directory) مانند Dmoz وابسته به کاربرانی است که آن را تکميل می‌کنند. شما صفحه مورد نظر را به همراه توضيحی كوتاه در فهرست ثبت می‌کنيد يا اين کار توسط ويراستارهايی که برای آن فهرست در نظر گرفته شده، انجام می‌شود. عمل جستجو در اين حالت تنها بر روی توضيحات ثبت شده صورت می‌گيرد و در صورت تغيير روی صفحه وب، روی فهرست تغييری به وجود نخواهد آورد. چيزهايی که برای بهبود يک فهرست‌بندی در يک موتور جستجو مفيد هستند، تأثيری بر بهبود فهرست‌بندی يک دايرکتوری ندارند. تنها استثناء اين است که يک سايت خوب با پايگاه داده‌ای با محتوای خوب شانس بيشتری نسبت به يک سايت با پايگاه داده ضعيف دارد. البته در مورد جستجوگرهای مشهور مانند گوگل و یاهو، یک مولفه دیگر هم برای بهبود فهرستبندی وجود دارد که کمک مالی (یا به اصطلاح اسپانسر) است، یعنی وب‌گاههایی که مایل به بهبود مکان وب‌گاه خود در فهرست بندی هستند، می‌توانند با پرداخت پول به این جستجوگرها به هدف خویش برسند.

3-3-موتورهای-جستجوی-ترکيبی-با-نتايج-مختلف
      به موتورهايی گفته می‌شود که هر دو حالت را در کنار هم نمايش می‌دهند. غالباً، يک موتور جستجوی ترکيبی در صورت نمايش نتيجه جستجو از هر يک از دسته‌های فوق، نتايج حاصل از دسته ديگر را هم مورد توجه قرار می‌دهد. مثلاً موتور جستجوی ام.اس.ان (MSN) بيشتر     نتايج حاصل از فهرست‌های تکميل‌دستی را نشان می‌دهد اما در کنار آن نيم نگاهی هم به نتايج حاصل از جستجوی پيمايشی دارد.

3-4-ابرجستجوگرها
      اين گونه جديد از موتورهای جستجوگر كه قدمت چندانی نيز ندارند،بصورت همزمان از چندین موتورجستجوگر برای کاوش در شبکه برای کلید واژه مورد نظر استفاده می کنند .بدين معنی كه اين موتور عبارت مورد نظر شما را در چندين موتورجستجوگر ‍ِ جستجو کرده و نتايج آنها را با هم تركيب كرده و يك نتيجه كلی به شما ارائه می‌دهد.به‌عنوان مثال موتورجستجوگر داگ پايل  از نتايج حاصل از  موتورهای Google - Yahoo - MSN و ASK استفاده كرده و نتيجه حاصله را به شما ارائه می‌دهد.لازم به ذکر است که روش و یا راهکار مشخص و یکسانی برای ترکیب نتایج حاصله از موتورهای پایه - موتورهایی که به عنوان موتور جستجوگر استفاده میشوند مانند Yahoo که یک موتور پایه برای dogpile میباشد - وجود ندارد.

4-    موتور جستجو چگونه کار میکند ؟

      طرز کار موتور جستجوگر به طور خلاصه بدین گونه است که ابتدا یک آدرس وب را می یابد، آن را دنبال می کند و به صفحه ای می رسد. محتوای آن صفحه را می خواند و پارامترهای آن را مشخص می کند. به عنوان مثال تعداد کلمات متن آن صفحه، حجم و تاریخ به روز رسانی آن، بعضی از پارامترهای آن صفحه است. سپس پارامترهای تعیین شده را به همراه آدرس آن صفحه به بایگانی موتور جستجوگر ارسال می کند و این اطلاعات در آنجا پس از فشرده سازی، ذخیره می گردد.
حال اگر کاربری که دنبال چیزی می گردد کلماتی را جستجو کند، موتور جستجوگر در پایگاه داده ای که تشکیل داده است ابتدا تمام صفحات مرتبط با موضوع جستجو شده را می یابد و سپس مرتبط ترین را به عنوان اولین نتیجه جستجو و بقیه صفحات را بر اساس میزان ارتباط بعد از آن در اختیار کاربر قرار می دهد. به عبارت دیگر اگر تعداد نتایج جستجو 1000 مورد باشد، سایت رده اول مرتبط ترین و سایت رده 1000 کم ارتباط ترین سایت به موضوع جستجو شده می باشد.وقتی جستجویی در یک موتور جستجوگر انجام و نتایج جستجو ارایه می شود، كاربران در واقع نتیجه كار بخش های متفاوت موتور جستجوگر را می بینند. موتور جستجوگر قبلا" پایگاه داده اش را آماده كرده است و این گونه نیست كه درست در همان لحظه جستجو، تمام وب را بگردد. بسیاری از خود می پرسند كه چگونه ممکن است گوگل در كمتر از یك ثانیه تمام سایت های وب را بگردد و میلیون ها صفحه را در نتایج جستجوی خود  ارایه كند؟

 هیچ موتور جستجوگر توانایی انجام این كار را ندارد. همه آنها در زمان پاسخ گویی به جستجوهای كاربران، تنها در پایگاه داده ای كه در اختیار دارند به جستجو می پردازند و نه در وب! موتور جستجوگر به كمك بخش های متفاوت خود، اطلاعات مورد نیاز را قبلا" جمع آوری، تجزیه و تحلیل می كند، آنرا در پایگاه داده اش ذخیره می نماید و به هنگام جستجوی-کاربر-تنها-در-همین-پایگاه داده  می گردد. بخش های مجزای یك موتور جستجوگر عبارتند از: Spider یا عنکبوت

Crawler یا خزنده

Indexer یا بایگانی کننده

Database یا پایگاه داده

 Ranker یا سیستم رتبه بندی

Spider (عنکبوت )

  
4-1 اسپایدر یا روبوت (Robot)، نرم افزاری است كه كار جمع آوری اطلاعات مورد نیاز یك موتور جستجوگر را بر عهده دارد. اسپایدر به صفحات مختلف سر می زند، محتوای آنها را می خواند، لینکها را دنبال می کند، اطلاعات مورد نیاز را جمع آوری می كند و آنرا در اختیار سایر بخش های موتور جستجوگر قرار   می دهد. كار یك اسپایدر، بسیار شبیه كار كاربران وب است. همانطور كه كاربران، صفحات مختلف را بازدید می كنند، اسپایدر هم درست این كار را انجام می دهد با این تفاوت كه اسپایدر كدهای HTML صفحات را می بیند اما كاربران نتیجه حاصل از كنار هم قرار گرفتن این كدها را. index.html صفحه ای است كه كاربران آنرا به صورت یک صفحه متنی میبینند : 

4-1-1  اما یک اسپایدر آنرا چگونه میبیند ؟

      برای این كه شما هم بتوانید دنیای وب را از دیدگاه یك اسپایدر ببینید، كافی است كه كدهای HTML صفحات را مشاهده کنید. برای این كار در مرورگر مورد استفاده خود، در قسمت View و قسمت page Source صفحه وب را بصورت کد HTML نشان میدهد .  

 با انجام این کار فایل متنی  به شما نشان داده می شود.

اسپایدر، به هنگام مشاهده صفحات، بر روی سرورها رد پا برجای می گذارد. شما اگر اجازه دسترسی به آمار دید و بازدیدهای صورت گرفته از یک سایت و اتفاقات انجام شده در آن را داشته باشید، می توانید مشخص كنید كه اسپایدر كدام یک از موتورهای جستجوگر صفحات سایت را مورد بازدید قرار داده است. یکی از فعالیتهای اصلی که در SEM انجام می شود تحلیل آمار همین دید و بازدیدها است.

 اسپایدرها كاربردهای دیگری نیز دارند، به عنوان مثال عده ای از آنها به سایت های مختلف مراجعه می كنند و فقط به بررسی فعال بودن لینك های آنها می پردازند و یا به دنبال آدرس ایمیل (Email) می گردند.

 

بندی بتواند پارامترهای صفحات مختلف را با هم مقایسه کند. در زمان تجزیه و تحلیل اطلاعات، ایندکسر برای كاهش حجم داده ها از بعضی كلمات كه بسیار رایج هستند صرفنظر می کند. كلماتی نظیر a ، an ، the  ، www ، is و ... . از این گونه كلمات هستند.

4-2-Crawler(خزنده)    
      كراولر، نرم افزاری است كه به عنوان یك فرمانده برای اسپایدر عمل می كند. آن مشخص می كند که اسپایدر كدام صفحات را مورد بازدید قرار دهد. در واقع کراولر تصمیم  می گیرد كه كدام یك از لینك های صفحه ای كه اسپایدر در حال حاضر در آن قرار دارد، دنبال شود. ممكن است همه آنها را دنبال كند، بعضی ها را دنبال كند و یا هیچ كدام را دنبال نكند.

کراولر، ممكن است قبلا" برنامه ریزی شده باشد که آدرس های خاصی را طبق برنامه، در اختیار اسپایدر قرار دهد تا از آنها دیدن کند. دنبال كردن لینك های یک صفحه به این بستگی دارد كه موتور جستجوگر چه حجمی از اطلاعات یک سایت را می تواند (می خواهد) در پایگاه داده اش ذخیره كند. همچنین ممكن است اجازه دسترسی به بعضی از صفحات به موتورهای جستجوگر داده نشده باشد.

شما به عنوان دارنده سایت، همان طور كه دوست دارید موتورهای جستجوگر اطلاعات سایت شما را با خود ببرند، می توانید آنها را از بعضی صفحات سایت تان دور كنید و اجازه دسترسی به محتوای آن صفحات را به آنها ندهید. موتور جستجو اگر مودب باشد قبل از ورود به هر سایتی ابتدا قوانین دسترسی به محتوای سایت را (در صورت وجود) در فایلی خاص بررسی می کند و از حقوق دسترسی خود اطلاع می یابد. تنظیم میزان دسترسی موتورهای جستجوگر به محتوای یک سایت توسط پروتكل Robots انجام می شود. به عمل کراولر ، خزش (Crawling) می گویند.

4-3 Indexer ( بایگانی کننده )

      تمام اطلاعات جمع آوری شده توسط اسپایدر در اختیار ایندکسر قرار می گیرد. در این بخش اطلاعات ارسالی مورد تجزیه و تحلیل قرار می گیرند و به بخش های متفاوتی تقسیم می شوند. تجزیه و تحلیل بدین معنی است كه مشخص می شود اطلاعات از كدام صفحه ارسال شده است، چه حجمی دارد، كلمات موجود در آن كدامند، کلمات چندبار تكرار شده اند، كلمات در كجای صفحه قرار دارند و ... .

 


در حقیقت ایندکسر، صفحه را به پارامترهای آن خرد می کند و تمام این پارامترها را به یک مقیاس عددی تبدیل می کند تا سیستم رتبه    4-4-DataBase-(پایگاه-داده)    
       تمام داده های تجزیه و تحلیل شده در ایندکسر، به پایگاه داده ارسال می گردد. در این بخش داده ها گروه بندی، كدگذاری و ذخیره می شود. همچنین داده ها قبل از آنكه ذخیره شوند، طبق تکنیکهای خاصی فشرده می شوند تا حجم كمی از پایگاه داده را اشغال كنند. یك موتور جستجوگر باید پایگاده داده عظیمی داشته باشد و به طور مداوم حجم محتوای آنرا گسترش دهد و البته اطلاعات قدیمی را هم به روز رسانی نماید. بزرگی و به روز بودن پایگاه داده یك موتور جستجوگر برای آن امتیاز محسوب می گردد. یكی از تفاوتهای اصلی موتورهای جستجوگر در حجم پایگاه داده آنها و همچنین روش ذخیره سازی داده ها در پایگاه داده است.

4-5-Ranker-(سیستم-رتبه-بندی)  
      بعد از آنكه تمام مراحل قبل انجام شد، موتور جستجوگر آماده پاسخ گویی به سوالات كاربران است. كاربران چند كلمه را در جعبه جستجوی (Search Box) آن وارد می كنند و سپس با فشردن Enter منتظر پــاسخ می مانند. برای پاسخگویی به درخواست کاربر، ابتدا تمام صفحات موجود در پایگاه داده كه به موضوع جستجو شده، مرتبط هستند، مشخص می شوند. پس از آن سیستم رتبه بندی وارد عمل شده، آنها را از بیشترین ارتباط تا كمترین ارتباط مرتب می كند و به عنوان نتایج جستجو به كاربر نمایش می دهد.   حتی اگر موتور جستجوگر بهترین و كامل ترین پایگاه داده را داشته باشد اما نتواند پاسخ های مرتبطی را ارایه كند، یك موتور جستجوگر ضعیف خواهد بود. در حقیقت سیستم رتبه بندی قلب تپنده یك موتور جستجوگر است و تفاوت اصلی موتورهای جستجوگر در این بخش قرار دارد. سیستم رتبه بندی برای پاسخ گویی به سوالات كاربران، پارامترهای بسیاری را در نظر می گیرد تا بتواند بهترین پاسخ ها را در اختیار آنها قرار دارد.

حرفه ای های دنیای SEM به طور خلاصه از آن به Algo ( الگوریتم) یاد می كنند. در حال حاضر قدرتمندترین سیستم رتبه بندی را گوگل در اختیار دارد.

می توان با ادغام کردن اسپایدر با کراولر و همچنین ایندکسر با پایگاه داده، موتور جستجوگر را شامل سه بخش زیر دانست که این گونه تقسیم بندی هم درست می باشد:

کراولر

بایگانی

سیستم رتبه بندی

5--ابزار جستجو در وب

     جستجوگران، بینندگان تصادفی نیستند. زمانی که آنها یک سری از کلمات را جستجو می کنند، به معنای آنست که آنها کالا یا خدماتی را می خواهند. لذا ترافیکی که به کمک موتورهای جستجوگر در سایت شما ایجاد می شود به معنای مراجعه گروه کاربران مخاطب به سایت شماست.
بسیار گفته شد که کاربران جستجو می کنند لذا بجا خواهد بود که روشن نماییم اصولا با چه ابزاری می توان در وب به جستجو پرداخت. خدمات جستجویی که در وب ارایه می شود را می توان در دو گروه اصلی-دسته-بندی-نمود:
•فهرستها
•موتورهایجستجوگر
 تفاوت اصلی این دو گروه نیز در نحوه تشکیل پایگاه داده و جمع آوری اطلاعات آنهاست. در فهرست ها، اینکار به عهده انسان است اما در موتورهای جستجوگر جمع آوری اطلاعات پایگاه داده را نرم افزارها انجام می دهند.

6- عملکرد موتور جستجو در بهینه سازی و مشکلات

6-1-پيش-پردازش-دادها

      يكي از راههايي كه موتورهاي جستجو ، براي كاهش زمان جستجو به كار مي برند ، پيش پرداش محتواي وب سايت هاست .به اين ترتيب كه وقتي كاربر درخواست يك پرس و جو را مي دهد .به جاي اين كه اين پرس وجو به ميليون ها وب سايت فرستاده شود، با داده از پيش پردازش شده در يك سايت مقايسه مي شود و مطابقت صورت مي پذيرد. پيش پردازش به كمك برنامه نرم افزاري به نام crawlerانجام میگيرد.
Crawler، به وسيله نگهدارنده ها و به روزكنندگان بانك هاي اطلاعاتي فرستاده مي شود تا فهرست صفحات وب را جمع آوري كند. يك برنامه ويژه رايانه اي، صفحات بازيافتي را پيمايش مي كند تا كلمات را استخراج نمايد و بعد اين كلمات همراه با لينكي به صفحه مربوط ،در فايل شاخص (index)ذخيره مي شود. پرس و جو هاي كاربران با همين فايل شاخص مقايسه و مطابقت داده مي شود ونه با ديگر وب سايت ها.

6-2-الويت-بندي-نتايج
      Urlيا لينيك هايي كه به عنوان نتايج جستجو توليد مي شوند معمولا خيلي زياد هستند ،اما همه اين نتايج به درد بخور نيستند و حتي ممكن است عواملي مثل ابهام زبان باعث شود نتايج مناسبي به كاربر داده نشود .براي فراهم كردن دسترسي سريع و در عين حال صفحات مناسب و اين كه صفحات با موضوعيت بيشتر در الويت بالاتري قرار بگيرتد ،الگوريتم هاي جستجو استراتژي هاي رتبه بندي مختلفي رابه كار مي برند . يكي از اين روش ها كه بسيار معمول است ، tfidf(term frequency inverse document trequncy) استدر اين روش چگونگي توزيع كلمات و تكرار آنها بررسي مي شود و براي كلمات، وزن عددي توليدمي شود . اين وزن به معني درجه اهميت و اعتبار آنها در اسناد مختلف است.به اين كار وزن دهي واژه(term weighting)گفته مي شود.وزن يك واژه به 2 عامل بستگي دارد: يكي دفعات تكرار واژه كه هر چه بيشتر با شد اهميت واژه بيشتر است و ديگري تواتر اسناد كه به معني تعداد اسنادي است كه شامل آن واژه است و هر چه اين مقدار بيشتر باشد ،اهميت واژه در تمايز اسناد كمتر خواهد بود .به اين ترتيب كلماتي كه تكرار بيشتري دارند مثل or , to,withو...نسبت به كلماتي كه از نظرمعنايي مناسب ترند و از طرف ديگر در متنهاي كمتري ظاهر مي شوند ،وزن كمتري خواهند داشت ؛البته عوامل ديگري مي توانند بر وزن (اهميت)يك واژه موثر باشند .محل وقوع واژه نمادهاي خاص مثل (font) و برچسب(tag) مربوط به واژه از آن جمله اند. معمولا كلمه اي كه در عنوان يك سند باشد مهمتر از واژه هاي خود متن است. همچنين واژ ه هاي خود متن است.همچنين واژه هاي نوشته شده با قلم خاص مهمتر از كلماتي است كه بدون اين ويژگي ها باشند.  علاوه بر وزن دهي واژه ها ،صفحات وب با استراتژي هاي ديگري هم وزن مي شود؛مثلا در روش تحليل لينك(Link analysis) ماهيت هر صفحه با توجه به ارتباط آن با ديگر صفحات در نظر گرفته مي شود.به اين ترتيب وزن دهي يك صفحه با توجه به تعداد صفحاتي كه به آن صفحه اشاره مي كنند يا بعكس،تعداد صفحاتي كه آن صفحه به آنها اشاره مي كند،صورت ميپذيرد.گوگل از اين روش براي بالا بردن نتايج جستجو استفاده مي كند.

6-3--موقعيت-و-مسافت

      اصطلاحCaching درباره موتورهاي جسجو هم كاربرد دارد. به اين ترتيب كه پرس وجو هايي كه بتازگي از سوي كاربران وارد شده ،در جايي نگهداري يا به اصطلاح Cache مي شود و پرس و جوي كاربر پس از ارسال به موتور جستجوبه كار مي رود. در واقع وقتي موتور جستجو املاي صحيح كلمه را به شما اعلام مي كند (Did you mean)از اين تكنيك بهره مي برد. استفاده از مدل تحويل توزيع شده (distributed delivery) راه ديگري براي سرعت دادن پاسخ گويي به درخواست هاي كاربران است .در اين مدل كپي هايي از شاخص ها ومطالب مربوط توليد مي شود وبه مكان هاي جغرافيايي متعددي انتقال مي يابد .

7--مشكلات
      همان طور كه گفتيم Crawler ها براي پيش پردازش و بازيابي صفحات به كار مي روند.بعضي Crawler ها به روش كوركورانه به بازيابي صفحات مي پردازند.روش كوركورانه به اين معني است كه به شهرت و اهميت يا به عبارتي قابل اعتماد بودن مطالب وتوليد كنندگان آنها توجهي ندارند.البته اين روش موجب شده سوء استفاده هايي در شاخص دهي و استفاده از موتورهاي جستجو صورت گيرد.يكي از اين كارها بهindex_spamming معروف است .بعضي سايت ها براي اينكه در بيشتر مواقع در نتايج جستجو قرار بگيرند و تعداد مراجعان بيشتري داشته باشند،هزاران بار لغات خاصي را در محتواي سايت خود قرار ميدهند تا از نظر موتورهاي جستجو اولويت و امتياز بيشتري را به خود اختصاص دهند. pagejackingيكي ديگر از اين حيله هاست .اين حيله از يكي از ويژگي هاي نرم افزارهاي وب سرورها،سوء استفاده مي كند .وب سرورها براي اينكه تعداد درخواستهاي يكيان بيشتري را در يك زمان پاسخ دهند ،(مثلا چند كاربر همزمان بخواهند به يك صفحه دسترسي پيدا كنند )مطالب هر صفحه را روي چند رايانه(با نشاني هاي مختلف كه از ديد كاربر مخفي است)قرار مي دهند و درخواست كاربران را به اين رايانه ها هدايت مي كنند .بعضي سايت ها از اين ويژگي نرم افزار استفاده و محتواي صفحات يك سايت را كپي مي كنند و در سايت خود قرار مي دهند . اين صفحات هم به وسيله موتورهاي جستجو ،شاخص دهي مي شود و در خواست بعضي كاربران به جاي صفحه اصلي به اين صفحات تقلبي ارجاع داده مي شوند .به اين ترتيب يك موتور جستجوي خوب علاوه بر جستجو و سرويس دهي خوب به كاربر بايد توانايي تشخيص جمله هاي اينترنتي را هم داشته باشد تا بتواند بهترين و صحيح ترين نتايج ممكن را در اختيار كاربران قرار دهد.

 

8-  نحوه افزودن آدرس سایت به موتورهای جستجو

8-1  چگونگی افزودن آدرس سایت در موتور جستجوی گوگل :
براي ثبت آدرس سایت یا وبلاگ خود در موتور جستجوي گوگل ابتدا به آدرس زير برويد:

          http://www.google.com/addurl/?continue=/addurl
سپس در قسمت Url ، آدرس سايت يا وبلاگ خود را وارد کنید و در بخش Comment آن هم یک توضيح مختصر در مورد مطالب سايت بنويسيد. در نهایت هم كد مورد نظری که در تصویر قرار گرفته را وارد کرده و روی Add Url كليك كنيد.

8-2 چگونگی افزودن آدرس سایت در موتور جستجوی یاهو:
براي ثبت آدرس سایت یا وبلاگ خود در موتور جستجوي یاهو ابتدا به آدرس زير برويد:

      http://submit.search.yahoo.com/free/request

      سپس با ID خود وارد ياهوي شويد. در صفحه ي بعد در قسمت Enter the Url for your Page آدرس سایت یا وبلاگ خود را وارد کنید.

8-3  چگونگی افزودن آدرس سایت در موتور جستجوی MSN:
براي ثبت آدرس سایت یا وبلاگ خود در موتور جستجوي MSN ابتدا به آدرس زير برويد:

      http://beta.search.msn.com/docs/submit.aspx

     در محل مشخص شده Type the URL of your homepage آدرس سایت یا وبلاگ خود را وارد كرده و كد  مشخص شده در تصویر را هم وارد كنيد و روی Submit Url را كليك كنيد.

9-  چند نمونه از موتورهای جستجوگر مهم

9-1  ياهو (YAHOO)

      ياهو ، مشهور ترين ابزار جستجوي موضوع گرا ، اشتراك جستجوهاي كليد واژه اي را از طريق پايگاه داده اينكتومي (Inktomi ) با تعدادي كمتر انجام مي دهد ولي برگزيده تر از گروه پايگاه ها ، ياهو براي جستجوي موضوعات در زمان شروع به جستجو ، داراي كارايي بالايي بوده و بهترين پايگاه ها را در موضوع هاي داده شده معرفي مي نمايد . اين دروازه وب و ابزار جستجو ، گروه هاي متعدد و اخبار را در اختيار قرار مي دهد .حراج ها ، مطالب طبقه بندي شده و وضعيت هوا و هزاران موضوع ديگر را مي توانيد در پايگاه ياهو بيابيد .                    9-2   اينفوسيك (Infoseek)

      اينفوسيك براي جستجوي وب و usenet از جمله مرور بعضي از سايت ها مناسب است .

9-3  آلتاويستا (ALTAVISTA)

       اين موتور جستجو ، شاخص بيش از30 ميليون صفحه و از آن جمله شاخص هاي پايگاه ياهو را در اختيار مي گذارد . حتي مراجع مبهم را در پايگاه هايي كه چندان نيز مشهور نيستند پيدا مي كند . نتايج و با توجه به اين امر كه كلمه جستجوي شما چند بار تكرار شده باشد ، رده بندي مي شود . اين پايگاه يكي از معدود پايگاه هاي داده است كه به شما اجازه مي دهد با محدود كردن تاريخ كار كنيد . اين موتور و پوشه جستجو ، ميليون ها پايگاه را مشخص (ايندكس) كرده است . كاربران مي توانند جستجو هاي پيچيده را انجام داده يا اخبار شخصي و اطلاعات مربوط به بورس را دريافت كنند .
9-4  اكسايت (Excite)

       با بيش از 50 ميليون پايگاه فهرست شده ، اين موتور جستجو متن كامل را جستجو مي كند . اين سايت ، اخيراً دو ابزار جستجوي ديگر را در اختيار گرفته است ، ماژلان (Magellan ) و وب كرالر(Web Crowler ) كه باعث تقويت قدرت آن به مثابه يك ابزار جستجو شده اند . اين سرويس مشهور را براي جستجو به كمك كليد واژه ها يا زنجيره هاي متني به كار بريد يا گروه هاي پايگاه هاي بررسي شده را مرور كنيد .

9-5   هات بات (HOTBOT)

    موتور جستجوي بي اندازه سريع با توان دسترسي به بيش از 50 ميليون پايگاه با ويژگي هاي بر جسته جستجو كه به نحوي شفاف در فهرست هاي راهنما توضيح داده شده اند . روباتي كه كار جستجو را انجام مي دهد اسلارپ ( Slurp) ناميده مي شود .

 


    


10-  نتیجه گیری

در دنیای بی کران اینترنت و حجم وسیع داده ها نیاز به ابزارهای با کیفیت و کمنیت مناسب امری ضروری است که با آشنایی با  مکانیزم های طراحی موتور جستجوی  میتوان تا حدودی این خلع را پوشاند در حال حاضر موتور های جستجوی موجود تقریبا از سرعت عمل خوبی در این راستا برخوردارند اما  در خصوص کیفیت حستجو همچنان باید تلاش نمایند . تا اختلال گران اینترنت نتوانند وقفه ای در ارتباط کاربران با پایگاه های داده ها ایجاد نمایند .

11-مراجع

[1] موروری بر وبلاک ها

[1]http://fa.wikipedia.org