خانه > دیتاست (data set) و مجموعه داده

دیتاست (data set) و مجموعه داده

مجموعه داده یا دیتاست (DataSet ) به داده‌ها گفته میشود که با موضوعیت و خواص مشخص و یکسان، جهت انجام تحقیقات و پروژه‌های مربوط به علم داده به جهت کسب دانش از داده ها استفاده می‌شوند. البته یک کاربرد دیگر دیتاست ها نیز برای مقایسه بین روش‌های مختلف هست، به این صورت که به‌طور نمونه بر روی دیتاست A، دو روش(الگوریتم) مختلف را اجرا کرده و با توجه به نتایج می‌توان بر اساس معیارهای دقت، سرعت و پیچیدگی هریک از روش‌ها را مقایسه کرد.

مهم‌ترین ابزار یک پژوهش‌گر برای ارائه‌ی تحلیل درست دیتا است، و استفاده از دیتای ناقص می‌تواند منجر به خطا در تحلیل شود و اثرات زیان‌باری در زمینه‌ی تصمیم‌گیری بر مبنای دیتا داشته باشد. در این وب سایت مجموعه داده هایی از حوزه های مختلف برای فعالیت های تحقیقاتی دانشجویان ارشد و دکترا به مرور قرار خواهیم گرفت.

دیتاست یا مجموعه داده

گاهی مجموعه داده های به این شکل به دنیا نی آیند که پژوهشگران در یک حوزه ای از پژوهش، شروع به جمع آوری داده یا بنچ مارک هایی می کنند تا در آن حوزه دیگر پژوهشگران به راحتی بتوانند کار آنها را گسترش دهند و همچنین پژوهش های خودشان عنی تر شود. از طرفی باید برای اثبات کارهای خود، این دیتاست ها را در اختیار عموم قرار دهند. آنچه مشخص است اینکه در مقالات معتبر باید لینک این دیتاست ها را قرار دهند.کار با این دیتاست ها برخی مواقع مشکل است. در این جور مواقع باید یا فایلی کنار آن قرار داده باشند که بتوان از روی آن تشخیص داد که دیتاست چیست و یا باید از خبره آن کمک گرفت.

پرکاربرد ترین استفاده از مجموعه داده به منظورتکنیک های یادگیری ماشین می باشد هر چند استفاده های فراوان دیگری از این مجموعه داده متصور است. ما قصد داریم تا پرکاربرد ترین دیتاست ها و مجمموعه داده های استاندارد (فارسی و جهانی) را در حوزه های مختلف برای تحلیل گران گرد آوری کنیم.

مجموعه داده اسامی مکان برای تشخیص مجودیت های مکانی در پردازش زبان طبیعی

اسامی مکان

مفدمه بر اسامی مکان: یکی از انواع موجودیت های نامدار، اسم مکان است. برای استفاده پژوهشگران دیتاستی شامل بیش از 300 هزار اسم مکان واقعی جهت استفاده در تشخیص مجودیت های مکانی ارائه شده است که می توانید در ادامه  آن را دانلود نمایید. تشخیص موجودیت‌های اسمی که یکی از حوزه‌های پژوهشی پردازش زبان طبیعی …

ادامه مطلب

دیتاست اسامی اشخاص حقیقی جهت استفاده در پردازش متن

اسامی اشخاص حقیقی

بانک اسامی اشخاص حقیقی جهت استفاده در تشخیص موجودیت های اسمی: یکی از انواع موجودیت های اسمی، اسامی اشخاص حقیقی است. برای استفاده شما مجموعه داده ای شامل بیش از 15000 نفر از اسامی اشخاص حقیقی جهت استفاده NER ارائه شده است که در ادامه می توانید آن را دانلود کنید. تشخیص موجودیت‌های اسمی که …

ادامه مطلب

مجموعه داده یا دیتاست برای یادگیری عمیق

دیتاست برای یادگیری عمیق

معمولا برای هر کار تحلیل در هر حوزه ای به مجموعه داده ی آن حوزه نیاز میباشد. کلید دستیابی به مهارت اصیل در یادگیری ماشین، تمرین کردن رویکرد های مختلف یادگیری ماشین با دیتاست های گوناگون است چرا که در یادگیری ماشین، هر مسئله، به خودی خود، یک مسئله منحصر به فرد محسوب می شود …

ادامه مطلب

مجموعه داده وسایل و تجهیزات (appliances) جهت متن کاوی

مجموعه داده وسایل

برای تشخیص اینکه یک کلمه اسم است، راه ­های مختلفی وجود دارد که از جمله­ ی آنها مراجعه به لغت نامه، استفاده از وردنت، در نظر گرفتن ریشه ­ی کلمه، استفاده از قواعد نحوی ساخت واژه و غیره می­ باشد. یکی از روش ها مرسوم تشخیص اسم ­ها با استفاده یک لغتنامه از اسامی افراد، …

ادامه مطلب

دیتاست ارقام دست نویس انگلیسی به منظور Machine Learning

ارقام دستنویس انگلیسی

 MNIST DataSet: این دیتاست شامل 60k تصویر 28×28 اعداد نویس برای آموزش سیستم و 10k تصویر برای تست است. بهترین نتیجه کسب شده برای این داده 99.79% می باشد. دانلود دیتاست ارقام دستنویس انگلیسی هدف این دیتاست در ابتدا دسته بندی انواع مختلف اعداد دست نویس انگلیسی بر اساس شکل ظاهری و سپس طبقه‌بندی ارقام …

ادامه مطلب

دیتاست ارقام دستنویس فارسی برای یادگیری ماشین

ارقام دستنویس فارسی

بازشناسی ارقام وحروف دستنویس فارسی. موضوعی است که سالهاست روی آن کار میشود چه در حوزه تحقیقات دانشگاهی وچه در حوزه های تجاری وکاربردی.مقالات وپایان نامه های در این زمینه ارئه شده است والبته کارهای صنعتی زیادی هم صورت گرفته است از مهمترین کاربردهای شناسایی ارقام وحروف دستنویس : · وارد کردن اطلاعات اسناد اداری …

ادامه مطلب

دانلود مجموعه داده (دیتا ست) اشعار مثنوی معنوی مولوی و دیوان شمس

مجموعه داده مثنوی معنوی

معمولا برای هر کار تحلیل در هر حوزه ای به مجموعه داده ی آن حوزه نیاز میباشد. در این پست مجموعه داده مثنوی معنوی برای انجام پردازش ها و انواع تحلیل های داده کاوی در اختیار قرار گرفته است. از لینک های زیر میتوانید مثنوی معنوی و دیولن شمس را دانبود نمایید. در پست های …

ادامه مطلب

دانلود مجموعه داده اخبار با طبقه بندی موضوعی (classification)

مجموعه داده اخبار

به منظور استفاده دانشجوبان عزیز در انجام پایان نامه حدود بیست هراز مجموعه داده اخبار با طبقه بندی موضوعی (classification) و خوشه بندی سلسله مراتبی در زیر برای دانلود ارائه شده است. دانلود مجموعه داده اخبار فارسی دسته بندی شده بررسی و مقایسه الگوریتمهای خوشه بندی سلسله مراتبی توصیف کلی از الگوریتمهای سلسله مراتبی در …

ادامه مطلب

مجموعه داده (Data Set) اشعار حافظ

مجموعه داده اشعار حافظ

معمولا برای هر کار تحلیل در هر حوزه ای به مجموعه داده ی آن حوزه نیاز میباشد. یکی از مشکلات دانشجویان ارشد و دکترا این است که: برای فلان تحقیق (مثلاً درس داده‌کاوی) یا پایان‌نامه، نیاز به یک دیتاست (DataSet = مجموعه داده) دارم، از کجا می‌توانم گیر بیاورم؟ هر چند می‌شود با جستجو، به …

ادامه مطلب

دانلود بانک تصاویر گوگل مپ برای زوم های مختلف

بانک تصاویر گوگل مپ

خدمات گوگل مپ، تحول بزرگی را در سیستم مسیریابی دنیا به ایجاد کرده است و به معنای واقعی کلمه جهان در جیب شماست را به جهانیان نشان داده است. اطلاعات بسیاری را درباره شهرها و مسیرها تنها با صرف کمی وقت و لمس چند گزینه، می‌توانید به ‌دست آورد. البته ویژگی‌های گوگل ‌مپ برای گوشی‌های …

ادامه مطلب

دیتاست اخبار حدود چهار هزار خبر فارسی به تفکیک تاریخ

دیتاست اخبار

مجموعه داده اخبار فارسی شامل بیش از سه هزار خبر از خبرگزاری های مختلف است. همه ما روزانه ده ها خبر مطالعه و جستجو می کنیم. دنبال کردن اخبار یکی از عادات روزانه ماست. در این دیتاست اخبار گوناگون جمع آوری شده است. این مجموعه داده شامل متن اخبار است.  فرمت این مجموعه داده پایگاه …

ادامه مطلب

دانلود مجموعه داده های هستان شناسی فارسی برای لغات هم معنا

مجموعه داده های هستان شناسی آنتولوژی فارسی

مجموعه داده های هستان شناسی و داده های پیوندی Linked Data هستی‌شناسی، دانش ساختاريافته در مورد يک حوزه خاص است که از طريق ارائه مفاهيم و روابط ميان آنها در آن حوزه شکل می‌گيرد. امروزه، به‌دليل طراحی هستی‌شناسی در حوزه‌های موضوعی مختلف، ارائه معيارهايی برای گزينش مناسب‌ترين هستی‌شناسی، ضروری است. دانلود مجموعه داده های هستان …

ادامه مطلب

دانلود دیتا ست قرآن عزیز

 دیتا ست قرآن کریم تنها سخنانی که بدون هیچ تغییر از مبدا آفرینش بر روی کره زمین در دستان بشر موجود است همین قرآن عزیز است. قرآن تنها جملات خداوند است که تا کنون بدون تغییر در اختیار انسان گذاشته شده است. دوستان بزرگواری که روی کارهای تحلیلی بر روی قرآن کریم کار میکنند میتوانند …

ادامه مطلب

دیتاست بیش از دویست و هفتاد هزار لینک فایل متنی

دیتاست فایل اسلاید پاورپوینت

دیتاست فایل متنی: در این پست مجموعه داده ای شامل بر  دویست و هفتاد هزار URL فایل پاورپوینت باموضوعات و زبان های متفاوت برای علاقه مندانی که تمایل به داده کاوی بر روی این گونه فایل ها هستند ارائه شده است. این لینک ها توسط وب سایت موتور جستجوی پاورپوینت از فضای وب آشکار جمع …

ادامه مطلب

مجموعه داده (dataset) گراف شبکه جاده ای پنسیلوانیا

گراف شبکه جاده ای

اطلاعات مجموعه داده (dataset)  گراف شبکه جاده پنسیلوانیا یکی از کاربرد های تحلیل شبکه های اجتماعی تحلیل سیستم حمل و نقل جاده ای است. در ادامه مجموعه داده ای از شبکه جاده ای به وسیله دانشگاه استند فورد برای دانلود فراهم شده است. این دیتاست یک شبکه جاده ای از پنسیلوانیا است. تقاطع ها و …

ادامه مطلب

انواع User Agent برای خزش در وب به صورت مودبانه (politeness)

انواع User Agent

پروتکل  HTTP یک پروتکل درخواست و پاسخ  است که بین یک کلاینت و یک سرور برقرار می شود . در اینجا کلاینت همان  User Agent (مرورگر شما) است و منظور از سرور یک وب سایت اینترنتی می باشد . نکته : User agent نوع مرورگر و سیستم عامل سرویس گیرنده را مشخص می نماید و …

ادامه مطلب