مرجع دیتاست فارسی
описание
لطفا برای معرفی و درج دیتاست خود داخل کانال به @data_hub پیام دهید.
3 259
подписчиков
Охват к подписчикам
79,5%
ERR
Реакции к просмотрам
0,32%
150 на 18 постов
Пересылки к просмотрам
1,91%
890
Постов в день
0,0
всего 20
Где отзываются чаще
доля реакций к просмотрам- 11 июл. 2025 г.📊 Senti-Persian – دیتاست تحلیل احساسات فارسی! اگه دنبال یه دیتاست حرفهای برای تحلیل احساسات به زبان فارسی هستی، Senti-Persian انتخاب مناسبیه! این دیتاست شامل 67,743 کامنت برچسبگذاریشده از سایتهای ایرانی (نماوا، فیلیمو، آپارات) و شبکههای اجتماعی (یوتیوب، توییتر، اینستاگرام) هست که با برچسبهای مثبت، منفی و خنثی دستهبندی شده. ✨ ویژگیها: – دادههای واقعی + دادههای مصنوعی تولیدشده با تکنیک GAN – بهبود دقت تحلیل احساسات از 88.4% به 96% – مناسب برای توسعه سیستمهای NLP فارسی 💡 کاربردها: – تحلیل احساسات کاربران – بهبود سیستمهای پیشنهاددهی – ابزارهای هوشمند در حوزه داده 🔗 لینک پروژه: https://github.com/engmahsa/Senti-Persian-Dataset 📥 امتحانش کن و نظرت رو برامون بنویس! #تحلیل_احساسات #دیتاست #NLP_فارسی #هوش_مصنوعی #پردازش_زبان0,65%
- 31 мая 2025 г.رفقا، تشخیص محتوای توهینآمیز تو فارسی سخته و وقتگیره🫠. امروز میخوایم یه دیتاست فوقالعاده برای تشخیص محتوای توهینآمیز در فارسی رو بهتون معرفی کنیم! با این دیتاست، میتونید مدلهای هوش مصنوعی رو برای شناسایی خودکار پیامهای نامناسب آموزش بدید و یه فضای آنلاین سالمتر بسازید.🤩 مشخصات و کاربردها ✨ بیش از ۱۰ هزار توییت فارسی برچسبخورده. شامل متن و برچسبهای توهینآمیز (توهین/عادی) و دستهبندیهای دقیقتر. عالی برای تشخیص توهین و آزار کلامی و ساخت فیلترینگ خودکار. 🔗 لینک دیتاست: github.com/golnaz76gh/pars-offensive-dataset اگر روی پروژههای تشخیص محتوا کار میکنی، این دیتاست میتونه کمک بزرگی باشه. حتماً یه نگاهی بنداز!0,64%
- 29 мая 2025 г.معرفی میزان (MIZAN)؛ جامعترین لیدربورد ارزیابی مدلهای زبانی بزرگ (LLM) در زبان فارسی پس از عرضهٔ بنچمارک FaMTEB برای ارزیابی مدلهای Text Embedding، اینبار تیم MCINEXT با دستاورد تازهای در پردازش زبان طبیعی فارسی گامی بلندتر برداشته است. 🔍 چرا میزان؟ ✅ مقایسه جامع مدلهای برتر دنیا — ارزیابی دقیق طیف گستردهای از مدلهای متنباز و بسته بهروز، با هدف ایجاد یک مرجع معتبر برای فارسیزبانان. ✅ پوشش ۶ بنچمارک تخصصی — طراحیشده توسط تیم MCINEXT برای سنجش عملکرد مدلها در چت، پیروی از دستورالعمل، NLU، NLG، استدلال منطقی و دانش عمومی. ✅ دسترسی به تحلیل دقیق عملکرد — هر بنچمارک در یک تب مجزا ارائه شده و شامل بررسی مدلها در تسکها، دیتاستها و متریکهای متنوع است (مثل تحلیل احساسات، طبقهبندی موضوعی، NLI، STS و... در بخش Persian NLU). ✅ تنوع کاربردی بالا — میزان مدلها را در سناریوهای واقعی فارسی مانند گفتوگوی چندمرحلهای، سیستمهای RAG، تولید محتوا و پاسخگویی منطقی ارزیابی میکند و به پژوهشگران کمک میکند بهترین مدل را برای نیاز خود انتخاب کنند. 🏆 بنچمارکهای کلیدی میزان: Persian MT-Bench: ارزیابی چت چندمرحلهای و کاربرد در سیستمهای RAG Persian IFEval: بررسی توانایی مدلها در پیروی از دستورالعملها PerCoR: اولین بنچمارک استدلال منطقی در زبان فارسی PerMMLU: سنجش دانش عمومی و تخصصی مدلها در موضوعات متنوع در زبان فارسی Persian NLU: ارزیابی درک زبان طبیعی فارسی Persian NLG: ارزیابی تولید زبان طبیعی فارسی 🔗 لیدربورد میزان را مشاهده کنید: 👉 https://lnkd.in/gPWdYyYG 📖 مقاله معرفی میزان در ویرگول: 👉 https://lnkd.in/gfE9R63Q 🔗 بنچمارک FaMTEB را مشاهده کنید: 👉 https://lnkd.in/guH8e8RS0,54%
- 16 февр.این نکتهی کنکوریای که میخوام بگم، دوتا پیشفرض خیلی ساده داره. پیشفرض اول اینه که هر دلار آمریکا، قیمتش تقریباً برابره با ۳٫۶۷۳ درهم. پس یه قانون ساده داریم برای محاسبهی ارزش دلار از روی درهم. پیشفرض دوم هم اینه که معمولاً (نه همیشه) قیمت دلار و تتر باید نزدیک به هم باشه. معمولاً تتر حدود ۵۰۰ تا ۱۰۰۰ تومن گرونتر از دلار فیزیکیه. مثلاً اگه کف بازار دلار فیزیکی ۱۰۰ هزار تومن باشه، انتظار داریم تتر حدود ۱۰۱ هزار تومن باشه. . حالا از این دو تا پیشفرض چه استفادهای میشه کرد؟ خیلی راحت. یه مثال عددی بزنم: فرض کن قیمت درهم خیلی راحت از توی نت درمیاری و ضربدر ۳٫۶۷۳ میکنی و میرسی به عدد ۱۰۰ هزار تومن. بعد میبینی دلار فیزیکی کف بازار ۹۰ هزار تومنه. (کلی کانال تلگرامی هست) این یعنی دلار کف بازار ۱۰ هزار تومن عقبتره و به احتمال زیاد قراره برسه به ۱۰۰ هزار تومن. پس اینجا یه فرصت برای خرید دلار فیزیکیه. ولی نکته جذابتر حالا میری توی سایتی مثل نوبیتکس و میبینی تتر مثلاً ۸۰ هزار تومنه. اینجا دیگه میشه گفت عالیترین فرصت خرید تتر. چرا؟ چون تتر حداقل قراره به ۹۰ هزار تومن برسه و احتمالاً حتی به ۱۰۰ هزار تومن هم برسه. به این کاری که گفتم معمولاً میگن نوسانگیری. من سعی کردم با یه مثال خیلی ساده توضیحش بدم.0,48%
- 9 июл. 2025 г.🎯 دیتاست Persian Instruct – مجموعه دادهای برای تنظیم دستورات به زبان فارسی! 📝 اگر به دنبال یک دیتاست باکیفیت برای انجام تسکهای مختلف پردازش زبان طبیعی (NLP) به زبان فارسی هستید، دیتاست Semi-Alpaca Instruction Tuning میتواند انتخاب بسیار خوبی باشد. این دیتاست برای پروژههایی مثل ترجمه ماشینی، تولید متن، و سایر کاربردها طراحی شده است. 📊 ویژگیهای دیتاست: – حاوی مجموعهای از دستورات به زبان فارسی برای تنظیم مدلها. – مناسب برای تسکهای متنوع NLP در زبان فارسی. – گردآوری شده با همکاری دانشجویان دانشگاه تهران. 🔗 لینک دیتاست: https://github.com/mostafaamiri/Persian_instruct_dataset 💡 اگر در حوزه NLP فارسی فعالیت میکنید، این دیتاست را از دست ندهید! #دیتاست #NLP_فارسی #پردازش_زبان #هوش_مصنوعی #تولید_متن #ترجمه_ماشینی #MachineLearning0,48%
- 2 июл. 2025 г.🎯 دیتاست Iranis – دیتاست فارسی برای شناسایی پلاک خودرو! 🚗✨ رفقا، امروز یه دیتاست فوقالعاده براتون داریم که شامل بیش از 83,000 تصویر از اعداد و حروف فارسی موجود روی پلاک خودروهاست. این دیتاست برای پروژههای تشخیص کاراکتر پلاک خودرو و سیستمهای بینایی ماشین بسیار کاربردیه! 📊 ویژگیها و مشخصات: – شامل تصاویر واقعی از پلاک خودروهای فارسی. – بیش از 83,000 نمونه تصویری از اعداد و حروف فارسی. – دستهبندی شده بر اساس اعداد، حروف و نمادهای خاص (مانند نماد ویلچر برای افراد دارای معلولیت). 💡 کاربردها: – تشخیص کاراکترهای پلاک خودرو. – آموزش مدلهای بینایی ماشین. – ساخت سیستمهای هوشمند شناسایی خودرو. 🔗 لینک دانلود دیتاست: github.com/alitourani/Iranis-dataset 📥 این پست رو برای کسایی که تو حوزه بینایی ماشین کار میکنن بفرست تا از این منبع ارزشمند استفاده کنن! 😊 #دیتاست #بینایی_ماشین #پلاک_خودرو #پردازش_تصویر #هوش_مصنوعی #تشخیص_کاراکتر #MachineLearning0,44%
- 14 июл. 2025 г.📚 RAG – سیستم پرسش و پاسخ برای فایلهای PDF فارسی! اگه دنبال یه سیستم هوشمند برای پرسش و پاسخ از فایلهای PDF فارسی هستی، پروژه RAG دقیقاً همون چیزی هست که نیاز داری! این پروژه، با استفاده از مدلهای زبان بزرگ و تکنیک Retrieval-Augmented Generation، اطلاعات مربوطه رو از فایلهای PDF استخراج میکنه و پاسخهای دقیق و مرتبط ارائه میده. ✨ ویژگیها: – پشتیبانی از فایلهای PDF فارسی – استفاده از مدل قدرتمند orca-tau-4k-persian-alpaca-f32 برای جستجوی معنایی و تولید پاسخ – استخراج اطلاعات مرتبط و دقیق با کمک کلاس PDFProcessor 💡 کاربردها: – پرسش و پاسخ از اسناد فارسی – جستجوی سریع و دقیق در فایلهای PDF – ابزارهای آموزشی و پژوهشی 🔗 لینک پروژه: github.com/zaha2020/RAG 📥 امتحانش کن و نظرت رو با ما به اشتراک بذار! 😊 #پرسش_پاسخ #PDF_فارسی #هوش_مصنوعی #پردازش_زبان #NLP_فارسی0,38%
- 22 июл. 2025 г.🤖 هوش مصنوعی داره شغلها رو یکی یکی فتح میکنه - میدونی کی نوبت شغل تو میرسه؟ رفقا سلام! یه الگوی جالب توی تاریخ فناوری وجود داره که نشون میده هوش مصنوعی چطور یه حوزه رو کامل تسخیر میکنه. شطرنج بهترین مثالشه: 🏁 مرحله اول: کنترل کامل انسانی (قرنها فقط انسانها بازی میکردن) ⚙️ مرحله دوم: موتورهای ساده (Deep Blue و امثالهم با brute force) 🤝 مرحله سوم: فاز سانتور (انسان + ماشین = بهترین ترکیب) 🚀 مرحله چهارم: استقلال کامل AI (AlphaZero که حتی به انسان یاد میده!) حالا سوال مهم: مهندسی نرمافزار کجاست؟ الان دقیقاً توی فاز سانتوریم! GitHub Copilot، ChatGPT و ابزارهای مشابه ما رو به برنامهنویسهایی تبدیل کردن که بدون اینا نمیتونیم با همون کیفیت و سرعت کار کنیم. ⚠️ اما مرحله بعد چی؟ آیا هوش مصنوعی روزی میتونه کامل مستقل کد بنویسه، باگ رفع کنه، و حتی خودش رو بهبود بده؟ 💡 راه حل؟ تحلیل داده! توی این دنیای در حال تغییر، یکی از امنترین و پولسازترین مسیرها، تبدیل شدن به تحلیلگر داده حرفهایه. چون هوش مصنوعی بدون داده هیچیه! 🎯 وبینار "مسیر شغلی تحلیلگر داده" اگه نمیدونی از کجا شروع کنی یا وسط این همه ابزار و دوره گم شدی، این وبینار نقشه راه شفاف و واقعی تو میشه. ✨ چی یاد میگیری؟ – رمزگشایی آگهیهای شغلی و شناخت نیاز واقعی شرکتها – معرفی ابزارهای پولساز و مسیر یادگیریشون – تشخیص منابع خوب از محتوای زرد – تکنیکهای یادگیری سریع برای Fast Learner شدن 🎓 بورسیه ۱۰۰٪ دیتاهاب: فقط کافیه پوستر وبینار رو توی شبکههای اجتماعی حرفهای خودت منتشر کنی و @DataHub_ir رو تگ کنی. کد تخفیف ۱۰۰٪ رو دریافت میکنی! ⏰ زمان: سهشنبه ۳۱ تیر، ساعت ۲۰:۰۰ 🔗 ثبتنام: https://zaya.io/gxxr0 🤔 سوال برای شما: به نظرتون کدوم حوزه بعد از شطرنج، کاملاً به هوش مصنوعی واگذار میشه؟ پزشکی؟ حقوق؟ یا خود مهندسی نرمافزار؟ 🎓 انجام پروژه | منتورشیپ | تدریس خصوصی @Data_hub 📊 پرشین دیتا، مرجع دیتاستهای فارسی! @persian_data #تحلیل_داده #هوش_مصنوعی #مسیر_شغلی #بورسیه0,34%
- 4 июл. 2025 г.🎯 ابزار مدلسازی موضوعات در متنهای کوتاه فارسی! 📝 اگر با چالش تحلیل و استخراج موضوعات از متنهای کوتاه فارسی (مثل توییتها یا پیامهای کوتاه) مواجه هستید، این ابزار میتواند نیاز شما را برطرف کند. با استفاده از تکنیکهای پیشرفته مانند LDA و NMF، میتوانید موضوعات کلیدی را از دادههای متنی استخراج کرده و آنها را در پروژههای خود به کار ببرید. 📊 ویژگیها و مزایا: – تمرکز بر متنهای کوتاه: ابزار بهینه برای دادههایی که طول متن در آنها محدود است. – روشهای متنوع: پشتیبانی از الگوریتمهای مختلف مدلسازی موضوعات برای مقایسه عملکرد و انتخاب بهترین روش. – قابلیت اجرا: امکان استفاده آسان در محیطهایی مثل Google Colab برای تست سریع و کارآمد. 💡 مناسب برای چه کسانی؟ – تحلیلگران داده و متخصصان NLP که به دنبال استخراج موضوعات از دادههای فارسی هستند. – کسانی که روی شبکههای اجتماعی، نظرسنجیها یا پیامهای کوتاه کار میکنند. – پژوهشگران و توسعهدهندگانی که نیاز به سازماندهی دادههای متنی دارند. 🔗 لینک ابزار و نحوه استفاده: https://github.com/DSInCenter/topicmodel 📥 اگر نیاز به استخراج موضوعات از متنهای کوتاه دارید، این ابزار را امتحان کنید! #مدل_سازی_موضوعات #پردازش_زبان #NLP_فارسی #تحلیل_متن #هوش_مصنوعی #متن_کوتاه #MachineLearning0,28%
- 7 июл. 2025 г.🎯 تشخیص منظور کاربر از جملات بلند و پیچیده! 🤖 اگر در حال توسعه چتبات یا سیستمهای هوشمند پردازش زبان طبیعی هستید، احتمالاً با چالش تشخیص منظور اصلی کاربر از جملات طولانی و پیچیده روبرو شدهاید. این پروژه به شما کمک میکند تا این چالش را مدیریت کنید و سیستمهای هوشمندتر و دقیقتری طراحی کنید. 📊 ویژگیها و مزایا: – تمرکز بر تحلیل و استخراج مقصود اصلی از جملات طولانی و همراه با اطلاعات حاشیهای. – مناسب برای توسعه چتباتها و سیستمهای پاسخگویی هوشمند. – استفاده از دادههای دستهبندیشده با مشخص بودن هدف اصلی کاربر. 💡 کاربردها: – توسعه چتباتهای پشتیبانی مشتری. – سیستمهای پاسخگویی هوشمند برای خدمات تلفن همراه، بانکداری، و سایر سرویسها. – بهبود تجربه کاربری در اپلیکیشنهای مبتنی بر مکالمه. 🔗 لینک پروژه و کدها: https://github.com/MojtabaZarreh/Recognizing-the-user-s-intent-from-long-and-complex-sentences 📥 اگر به دنبال راهحلی برای تحلیل دقیقتر نیازهای کاربران هستید، این پروژه را بررسی کنید! #تشخیص_مقصود #پردازش_زبان #NLP_فارسی #چت_بات #هوش_مصنوعی #تحلیل_متن #MachineLearning0,28%
- 16 июл. 2025 г.🗣 هوش مصنوعی پرسش و پاسخ صوتی فارسی! پروژه Persian Question Answering Voice2Voice AI یه سیستم هوشمند حرفهایه که به صورت صوتی با کاربر تعامل داره! یعنی شما سوالتون رو میپرسید و هوش مصنوعی به زبان فارسی جواب میده - هم به صورت صوتی و هم متنی. ✨ قابلیتهای کلیدی: مکالمه صوتی دوطرفه کاملاً به زبان فارسی نسخه بومی شده و قابل اجرا بدون اینترنت مدل آموزشی اختصاصی برای پردازش زبان طبیعی جمعآوری دادهها با خزندههای اختصاصی 🔗 لینک پروژه: https://github.com/M-Taghizadeh/Persian_Question_Answering_Voice2Voice_AI امتحانش کن و نظراتت رو با ما به اشتراک بذار 👇 #هوش_مصنوعی_فارسی #پردازش_صوت #NLP #پرسش_و_پاسخ #پروژه_پایتون0,26%
- 21 июл. 2025 г.🎙 دیتاست متن تولیدشده توسط هوش مصنوعی فارسی اگه دنبال دیتاستی برای شناسایی متنهای تولیدشده توسط هوش مصنوعی به زبان فارسی هستی، پروژه Persian AI-Generated Text Detection به کارت میاد! این پروژه هدفش استخراج متنهای فارسی تولیدشده توسط کتابخانه OpenAI GPT و ساخت دیتاستی ارزشمند برای آموزش مدلهای شناساییه. ✨ چی داره؟ 🗂 ایجاد یک دیتاست بزرگ از متنهای فارسی تولیدشده توسط هوش مصنوعی 🛠 فراهم کردن دادههای آموزشی برای مدلهای شناسایی متنهای AI 🔗 لینک پروژه: https://github.com/E-Ghafour/Persian_AI_generated_text_detection 📥 امتحانش کن و اگر دیتاست جالبی پیدا کردی، برای ما هم بفرست! 😊 🎓 انجام پروژه | منتورشیپ | تدریس خصوصی @Data_hub 📊 پرشین دیتا، مرجع دیتاستهای فارسی! @persian_data #تشخیص_متن_AI #هوش_مصنوعی_فارسی #دیتاست #پردازش_زبان #تولید_متن0,22%