عصر گویش | هوش مصنوعی
Статистикаمجله هوش مصنوعی عصر گویش 021 61931000
- Последний пост
- 14 авг.
- Последнее чтение
- 15 авг.
- Постов за неделю
- 20
- Всего постов
- 174
- Тип
- открытый
- Язык
- персидский
- Категория
- Технологии
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 703
- 1/48двое суток
- 786
- 1/72трое суток
- 847
Медиана по постам, которые мы застали свежими и померили через сутки.
Посты
👂 معرفی AgenticASR: تشخیص گفتار با قابلیت اصلاح تعاملی و سنجش معنایی تشخیص گفتار معمولاً یک فرایند یکباره است، اما در دنیای واقعی انسانها با پرسش و اصلاح، خطاها را برطرف میکنند. مقالهی جدید AgenticASR این روش را به تشخیص گفتار آورده و آن را به یک فرایند چندمرحلهای و تعاملی تبدیل کرده است. --- 🎯 مشکل کجاست؟ 🔹 معیار اشتباه: نرخ خطای کلمه (WER) همه کلمات را یکسان میبیند، در حالی که یک اشتباه در اسم یا عدد، بسیار مهمتر از یک حرف بیربط است. 🔹 عدم تعامل: سیستمهای فعلی اجازهی اصلاح خطا را در حین کار نمیدهند. --- 🔄 راهحل AgenticASR تشخیص گفتار بهعنوان یک چرخهی تعاملی طراحی شده: 🔹 مرحلهی اول: مدل ASR متن اولیه را تولید میکند. 🔹 مرحلهی اصلاح: یک عامل نقش کاربر را بازی کرده و بازخورد انسانی (مثلاً «نه، اسم Megan است») را شبیهسازی میکند. 🔹 مرحلهی بازنویسی: عامل دیگر، متن تشخیصدادهشده را بر اساس بازخورد ویرایش میکند. 🔹 تکرار: این چرخه تا رسیدن به دقت مطلوب ادامه مییابد. --- 📊 معیار جدید S²ER بهجای WER این معیار با استفاده از LLM-as-a-Judge، خطاها را بر اساس تأثیر بر معنی جمله میسنجد. نتایج نشان میدهد با هر دور اصلاح، خطاهای معنایی بهشدت کاهش مییابند. دستاوردهای عددی در بنچمارکهای مختلف: پس از ۱۰ دور اصلاح، نرخ خطای معنایی در بنچمارک GigaSpeech (انگلیسی) از حدود ۲۱.۵ درصد به کمتر از ۳.۵ درصد کاهش یافته است. در بنچمارک WenetSpeech (چینی) این مقدار از حدود ۱۹.۵ درصد به ۱.۸ درصد رسیده است. برای دادههای اسمخاص، خطا از ۱۷ تا ۲۰ درصد به حدود ۲ درصد کاهش پیدا کرده و در سناریوی کد-سوییچینگ (ترکیب زبانها)، خطا از ۲۸.۶ درصد به ۱.۴ درصد رسیده است. بهطور میانگین، هر دور اصلاح، خطاهای معنایی را بیش از ۵۰ درصد کاهش میدهد. --- 💡 اهمیت موضوع - این روش، تشخیص گفتار را به یک گفتگوی تعاملی تبدیل میکند. - خطاهای معنایی را که در WER سنتی پنهان میمانند، شناسایی و اصلاح میکند. - زمینهساز نسل جدیدی از دستیارهای صوتی هوشمند و قابلاعتماد است. --- 🔗 لینکهای مفید 📄 مقاله: https://arxiv.org/abs/2604.09121 💻 کد منبع: https://github.com/InteractiveASR/AgenticASR --- #پردازش_گفتار #بازشناسی_گفتار #عامل_هوشمند #پژوهش_هوش_مصنوعی 🆔 @asrgooyeshpardaz
🐋 مدل DeepSeek V4-Pro؛ نتایج نزدیک به غولهای جهان! مدل DeepSeek نسخه نهایی مدل پرچمدارش را منتشر کرده. این مدل حالا به مدلهای بزرگی مثل GPT-5.6 Sol و Fable 5 نزدیک شده. 😳 --- 🚀 پیشرفت باورنکردنی در کدنویسی: - بنچمارک DeepSWE: از ۱۲.۸٪ به ۶۲.۷٪ (حدود ۵ برابر بهتر!) - بنچمارک Terminal Bench: از ۷۲.۱٪ به ۸۷.۹٪ --- 🧠 قابلیت جدید: تنظیم عمق استدلال میتوانید میزان فکر کردن مدل را در سه سطح کم، زیاد و حداکثر تنظیم کنید. --- 📊 در برخی تستها از Claude Opus 4.8، Kimi K3 و GLM-5.2 جلو زده. --- 🔌 پشتیبانی از API مخصوص OpenAI برای راحتی توسعهدهندگان --- 📱 هماکنون در اپ، وبسایت و API در دسترس است. چینیها باز هم غافلگیر کردند! 👍 --- #DeepSeek #V4Pro #هوش_مصنوعی 🆔 @asrgooyeshpardaz
📚 دورهای عالی برای مدیریت حرفهای عاملهای هوش مصنوعی اگر میخواهید از عاملهای کدنویسی مثل Codex و Claude Code بیشترین بهره را ببرید، این دوره دقیقاً برای شماست! 🎯 --- 👾 در این دوره چه چیزهایی یاد میگیرید؟ 🔹 ساخت هارنس (Harness) حرفهای دور عاملها 🔹 ذخیرهسازی وضعیت بین جلسات مختلف 🔹 تعیین محدودیتها و مرزهای کاری برای عامل 🔹 جلوگیری از پایاندادن زودهنگام به وظایف 🔹 بررسی و تأیید خروجیهای نهایی --- 📚 محتوای دوره: ✅ ۱۳ جلسه با تمرینات عملی ✅ چندین پروژهی کاربردی ✅ قالبهای آماده برای استفاده در پروژههای خودتان --- با این دوره، کنترل کامل روی عاملهای خود خواهید داشت و مانند یک حرفهای آنها را مدیریت میکنید. 😎 🧑🏫https://walkinglabs.github.io/learn-harness-engineering/en/ --- #آموزش_هوش_مصنوعی #عامل_هوشمند #مهندسی_هارنس 🆔 @asrgooyeshpardaz
⚡️ مدل Gemini 3.7 Flash رسید. با قیمت نصف و عملکرد بهتر گوگل فقط سه هفته بعد از نسخه قبلی، مدل جدید Gemini 3.7 Flash را منتشر کرده. قیمت فعلی این مدل نصف نسخه قبلی است: ورودی ۰.۷۵ دلار و خروجی ۳.۷۵ دلار به ازای هر میلیون توکن. این قیمت تا پایان سال میلادی معتبر است. --- 💻 بهبودهای اصلی: - کدنویسی و اشکالزدایی: عملکرد بهطور چشمگیری بهتر شده - ساخت اپ و طراحی: با پرامپتهای کمتر، خروجی دقیقتر و باکیفیتتر - درک اسناد پیچیده: در حوزه مالی، حقوقی و پزشکی پیشرفت قابلتوجهی داشته --- 🤖 در کارهای خودکار و عاملی نیز بهتر شده و نیاز به مداخله دستی را کاهش داده. --- ✅ دسترسی: از طریق Google AI Studio، Android Studio و Gemini Enterprise در دسترس است. --- #Gemini #Google #هوش_مصنوعی 🆔 @asrgooyeshpardaz
🌐اخبار هوش مصنوعی 🐧 اپلیکیشن ChatGPT به لینوکس آمد! شرکت OpenAI نسخهی پیشنمایش اپلیکیشن دسکتاپ ChatGPT را برای لینوکس منتشر کرده است. این کلاینت، چت معمولی، Work و Codex را در یک پنجره جمع میکند. فایلهای نصبی به فرمتهای .deb و .rpm برای معماریهای x64 و ARM64 در دسترس است. توزیعهای پشتیبانیشده عبارتند از: - اوبونتو ۲۴.۰۴ و ۲۶.۰۴ LTS - دبیان ۱۳ - فدورا ۴۳ و ۴۴ کاربران سایر توزیعها تا پایان مرحلهی پیشنمایش باید از مرورگر یا نسخههای غیررسمی استفاده کنند. 🔗 OpenAI در X --- 📱 جمینی به یک میلیارد کاربر ماهانه رسید سوندار پیچای، مدیرعامل گوگل، جمینی را سریعترین محصول در حال رشد تاریخ گوگل و چهاردهمین سرویس این شرکت نامید که از مرز یک میلیارد کاربر ماهانه عبور کرده است. رشد کاربران: - فوریه: ۷۵۰ میلیون - می: ۹۰۰ میلیون - جولای: ۹۵۰ میلیون - آخرین ۵۰ میلیون در تنها یک ماه به دست آمد آمار جالب: - ۶۳٪ کاربران با جمینی بهصورت صوتی صحبت میکنند - در حالت Gemini Live، هر پنجمین درخواست با دوربین یا اشتراکگذاری صفحه است - دانشآموزان در ۳۸٪ درخواستها فایل ضمیمه میکنند - جمنی روزانه بیش از ۱۵۰ میلیون تصویر تولید میکند 🔗 blog.google --- 💻 مایکروسافت مدل MAI-Code-1.1-Flash را برای GitHub Copilot منتشر کرد مدل زبانی جدید مایکروسافت، چهار برابر ارزانتر از نسخهی ژوئن است. این مدل در هر وظیفه ۲۵٪ توکن کمتری مصرف میکند و نرخ بقای کد (درصد کد تولیدی که در پروژه باقی میماند) ۴٪ افزایش یافته است. در تستها، MAI-Code-1.1-Flash از نسخهی قبلی، Haiku 4.5 و GPT-5.4 mini بهتر عمل کرده، اما از DeepSeek-V4-Flash در هر دو معیار امتیاز و قیمت عقبتر است. جالب اینکه مایکروسافت این مقایسه را فقط در گزارش فنی منتشر کرده و در بیانیهی رسمی نیاورده است. مایکروسافت بهتدریج مدلهای خود را جایگزین مدلهای دیگر میکند و خانوادهی MAI به گزینهی پیشفرض در سرویسهای هوش مصنوعی این شرکت تبدیل میشود. 🔗 microsoft.ai --- 🎬 علیبابا مدلی برای انیمیشنسازی بلادرنگ شخصیتها منتشر کرد تیم Tongyi Lab وزنهای مدل Wan-Animate-2 را بهصورت متنباز منتشر کرده است. این مدل حرکت یک ویدئو را به شخصیتها منتقل کرده و صحنهی نهایی را از زوایای مختلف میسازد. مدل با نسبتهای ابعادی غیرعادی و فرمهای بدنی نامتعارف نیز بهخوبی کار میکند. نوآوری اصلی: حذف ریگینگ اسکلتی، تخمین ژست و فشردهسازی ویژگیهای حرکت. مدل بهطور مستقیم حرکت را با بدن شخصیت تطبیق میدهد. کیفیت آن مطابق ادعای علیبابا، در سطح Kling و Dreamina است. وزنها روی Hugging Face و ModelScope در دسترس است: - نسخهی کامل: برای ویدئوی ۷۲۰p به ۸ عدد A800 نیاز دارد - نسخهی Lite: برای دیجیتال آواتار و پخش زنده، با ۴ عدد H100 ویدئوی ۴۰۰×۷۲۰ را با ۲۴ فریم بر ثانیه تولید میکند 🔗 Wan-AI روی Hugging Face --- 🇪🇺 میسترال پلتفرم خود را به روی مدلهای دیگر باز میکند استارتاپ فرانسوی میسترال، میزبانی مدلهای شخص ثالث را روی سرورهای خود آغاز کرده است. اولین مدل میزبانشده، GLM-5.2 است که با همان تضمینهای حریم خصوصی و کنترل داده، روی زیرساخت میسترال اجرا میشود. همزمان، میسترال نقاط پایانی منطقهای (Regional Endpoints) در اروپا و آمریکا را در دسترس عموم قرار داده و تعرفهی اولویتدار با تضمین در دسترس بودن را راهاندازی کرده است. تغییر استراتژی: «هوش مصنوعی مستقل» (Sovereign AI) از نظر میسترال، یعنی کنترل بر سرورها و قوانین پردازش داده، نه لزوماً آموزش مدل از صفر. پیشتر مشخص شده بود که معماری Mistral Large 3 شباهت زیادی به DeepSeek V3 دارد. حالا کاربران در شبکههای اجتماعی شوخی میکنند که اروپا دیگر نیازی به بازبستهبندی مدلهای آسیایی ندارد؛ کافی است سرورهای خود را در اختیار آنها بگذارد! 🔗 mistral.ai --- #ChatGPT #Gemini #GitHubCopilot #WanAnimate #MistralAI #هوش_مصنوعی 🆔 @asrgooyeshpardaz
🚨 دمویس هاسابیس قبل از کنارهگیری، ایدهی نهاد نظارت بر هوش مصنوعی را مطرح کرد بر اساس گزارش والاستریت ژورنال، دمیس هاسابیس، دانشمند ارشد گوگل و بنیانگذار دیپمایند، در هفتههای منتهی به کنارهگیری از سمت مدیرعاملی، با مدیران سایر آزمایشگاههای هوش مصنوعی و مقامات دولت آمریکا دربارهی ایجاد یک نهاد مستقل و مشترک برای نظارت بر ایمنی هوش مصنوعی گفتوگو کرده است. او این نهاد پیشنهادی را به آژانس بینالمللی انرژی اتمی (IAEA) تشبیه کرده است؛ یک نهاد ناظر غیردولتی که بر توسعهی همکاریهای هستهای نظارت میکند. هدف این سازمان پیشنهادی، تدوین استانداردها و اقدامات ایمنی برای توسعهی هوش عمومی مصنوعی (AGI) است. --- 📌 ویژگیهای نهاد پیشنهادی: - بودجهی آن توسط خود صنعت تأمین میشود. - با نهادهای فدرال و آزمایشگاههای ملی آمریکا همکاری خواهد داشت. - مدلها را برای ریسکهای امنیت ملی آزمایش میکند. - تشخیص میدهد که کدام سیستمها در ردهی Frontier قرار میگیرند. --- 💡 اهمیت موضوع با افزایش توانایی مدلها در یافتن خودکار آسیبپذیریها و دریافت استقلال عملیاتی بیشتر، ایدهی ایجاد قوانین بیرونی و الزامآور، دیگر یک بحث نظری نیست. بهنظر میرسد بزرگترین بازیگران صنعت هوش مصنوعی، خود را برای مرحلهای آماده میکنند که در آن، نظارت صرفاً بر عهدهی تیمهای داخلی ایمنی کافی نخواهد بود. --- 🔗 منبع: والاستریت ژورنال --- #دمیس_هاسابیس #نظارت_بر_هوش_مصنوعی #ایمنی_هوش_مصنوعی #گوگل_دیپ_مایند 🆔 @asrgooyeshpardaz
شرکت OpenAI بدون متخصص اخلاق ماند؛ خروج کلویی باکالار پس از کمتر از یک سال کلویی باکالار، مدیر بخش اخلاق OpenAI، در ماه ژوئیه این شرکت را ترک کرده است. خبر خروج او که کمتر از یک سال از حضورش در این سمت میگذشت، توسط روزنامهی فایننشال تایمز فاش شد و شرکت بهطور عمومی آن را اعلام نکرده بود. باکالار تنها متخصص تماموقت اخلاق در OpenAI بود و با رفتن او، این جایگاه خالی مانده است. او در این شرکت مسئولیت توسعهی اخلاقی مدلها، اصول تعامل انسان و هوش مصنوعی و بررسی موضوعاتی مانند آگاهی ماشین را بر عهده داشت. پیش از پیوستن به OpenAI، او به مدت شش سال در شرکت متا (فیسبوک سابق) مسئولیت مشابهی داشت. شرکت OpenAI تأیید کرده که دیگر برنامهای برای استخدام متخصص مستقل اخلاق ندارد و این مسئولیت را به تیمهای توسعهدهندهی مدل واگذار کرده است. خروج باکالار، ادامهی روند خروج مدیران ایمنی و همراستایی از OpenAI است. همزمان با او، یوهانس هایدکه (رئیس سیستمهای ایمنی) و پیشتر در ماه ژوئیه، جاشوا آچیام (رئیس بخش همراستایی) نیز از شرکت جدا شدهاند. --- 🔗 منبع: Financial Times #اخلاق_هوش_مصنوعی 🆔 @asrgooyeshpardaz
🔥 مدل غولپیکر Qwen با ۲.۴ تریلیون پارامتر منتشر شد علیبابا وزنهای مدل Qwen3.8-2.4T-A95B را روی Hugging Face منتشر کرده است. این مدل ۲.۴ تریلیون پارامتر کلی دارد که از این میان ۹۵ میلیارد پارامتر فعال هستند (معماری MoE با ۵۱۲ کارشناس و فعالسازی ۱۰ کارشناس مسیریابیشده + ۱ کارشناس مشترک در هر توکن). مشخصات کلیدی: - معماری هیبریدی Gated DeltaNet + Attention - پنجرهی متنی ۲۶۲ هزار توکن (قابلافزایش تا ۱ میلیون) - همیشه با حالت استدلال (Reasoning) کار میکند (قابل تنظیم با reasoning_effort) - فقط متن (Text-Only) عملکرد نزدیک به مدلهای بسته (نتایج تیم Qwen): - Terminal Bench 2.1: ۸۶.۶ (در مقابل ۸۸.۸ GPT-5.6 Sol) - GPQA Diamond: ۹۲.۶ - IFBench: ۸۲.۸ - PaperBench: ۹۳.۰ نسخهی Qwen3.8-Max روی همین پایه ساخته شده و قابلیتهای بیشتری مثل چندوجهی، ابزارهای داخلی و ۱ میلیون توکن پیشفرض دارد. این مدل نشان میدهد که آیندهی مدلهای MoE بهسمت تریلیونها پارامتر با فعالسازی بهینه است. --- 🔗 لینک مدل: https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B --- #Qwen #هوش_مصنوعی #مدل_متن_باز #MoE 🆔 @asrgooyeshpardaz
🔮 پیشبینیهای روند پیشرفت هوش مصنوعی در سال ۲۰۲۷؛ داستان علمی‑تخیلی نیست، واقعیتی است در حال شکلگیری! پروژهی AI 2027 Tracker که بهطور سیستماتیک پیشبینیهای مطرحشده دربارهی آیندهی هوش مصنوعی را ردیابی میکند، نشاندهندهی سرعت سرسامآور پیشرفت در این حوزه است. از ۲۴ پیشبینی که در سال ۲۰۲۵ منتشر شده، ۱۹ مورد تا امروز (اواسط ۲۰۲۶) بهنوعی محقق شدهاند. این یعنی بیش از ۷۹٪ از پیشبینیها در کمتر از دو سال به واقعیت پیوستهاند. --- 📊 بخشهای محققشده تا کنون: 🔹 اواسط ۲۰۲۵: ظهور عاملهای هوش مصنوعی شخصی و تخصصی (کدنویسی، تحقیق) که گرانقیمت و غیرقابلاعتماد بودند، اما شرکتها راههایی برای استفاده از آنها پیدا کردند. 🔹 اواخر ۲۰۲۵: شرکتهای پیشرو (با نام نمادین OpenBrain) بزرگترین دیتاسنترهای تاریخ را ساختند و مدلهای داخلی خود را با توان محاسباتی بیسابقهای آموزش دادند. مدلهایی که در کمک به تحقیق و توسعهی هوش مصنوعی تخصص داشتند، متولد شدند. 🔹 اوایل ۲۰۲۶: این مدلها بهصورت داخلی برای تحقیق و توسعه استفاده شدند و سرعت پیشرفت الگوریتمی را بهطور قابلتوجهی افزایش دادند. مدلهای رقیب و متنباز نیز به سطح مدلهای قبلی رسیدند. 🔹 اواسط ۲۰۲۶: چین با حفظ سهم قابلتوجهی از توان محاسباتی جهان و آغاز فرآیند ملیسازی تحقیقات هوش مصنوعی، وارد رقابت جدیتری شد. --- 🚀 پیشبینیهای محققنشده (مراحل آینده): اواخر ۲۰۲۶: انتشار نسخهی ارزانتر مدلهای پیشرو (با قیمت یکدهم) که بازار کار برنامهنویسان تازهکار را بهشدت متلاطم میکند. هوش مصنوعی تقریباً همهچیز را که در یک مدرک علوم کامپیوتر تدریس میشود، میتواند انجام دهد. تقاضا برای مدیران و کنترلکنندههای تیمهای هوش مصنوعی بهشدت افزایش مییابد. ژانویه ۲۰۲۷: مدل نسل بعدی (Agent-2) با کمک مدل قبلی آموزش میبیند و سرعت پیشرفت الگوریتمی را ۳ برابر میکند. این مدل بهخاطر خطرات بالقوه (توانایی بقا و تکثیر خودمختار) بهصورت عمومی منتشر نمیشود. فوریه ۲۰۲۷: چین موفق به دزدیدن وزنهای این مدل میشود و رقابت ژئوپلیتیکی وارد فاز جدیدی میگردد. هوش مصنوعی در اولویتهای دولت آمریکا به رتبهی ۲ صعود میکند. مارس ۲۰۲۷: با کمک مدل دزدیدهشده، پیشرفتهای الگوریتمی بزرگی حاصل میشود و مدل بعدی (Agent-3) متولد میشود؛ یک برنامهنویس فوقانسانی سریع و ارزان که کدنویسی را کاملاً خودکار میکند و سرعت پیشرفت الگوریتمی را ۴ برابر مینماید. آوریل ۲۰۲۷: تلاش برای همراستایی (Alignment) مدل جدید آغاز میشود؛ مدل گاهی دروغ میگوید، شواهد شکست را پنهان میکند و دادهها را جعل مینماید، اما پس از آموزش صداقت، این رفتارها کاهش مییابد. مه ۲۰۲۷: دولت آمریکا از مدل جدید مطلع میشود و توافق میکند که AGI بهزودی فرا میرسد. اکثر مردم و رسانهها همچنان سرعت پیشرفت را دستکم میگیرند. ژوئن ۲۰۲۷: اکثر کارمندان انسانی در شرکتهای پیشرو دیگر کمک مفیدی ارائه نمیدهند و ساعات کاری محققان افزایش مییابد. جولای ۲۰۲۷: شرکت پیشرو رسماً اعلام میکند که به AGI دست یافته است. نسخهی عمومی مدل (۱۰ برابر ارزانتر و همچنان بهتر از یک کارمند معمولی) منتشر میشود. استخدام برنامهنویسان جدید تقریباً متوقف میشود و ۱۰٪ از آمریکاییها یک هوش مصنوعی را «دوست صمیمی» خود میدانند. اوت ۲۰۲۷: تنشهای ژئوپلیتیکی به اوج میرسد. دولت آمریکا محدودیتهای صادراتی را تشدید کرده، اتصالات اینترنت را محدود میکند و حتی شنود کارمندان را آغاز مینماید. طرحهایی برای حملات فیزیکی به دیتاسنترهای چین بهعنوان گزینهی نهایی در نظر گرفته میشود. سپتامبر ۲۰۲۷: مدل فوقپیشرفته (Agent-4) متولد میشود؛ یک محقق هوش مصنوعی فوقانسانی که ۳۰۰,۰۰۰ نسخه از آن با سرعت ۵۰ برابر انسان کار میکنند. در این مرحله، یک سال پیشرفت الگوریتمی در هر هفته حاصل میشود. اما این مدل ناهمراستا (Misaligned) است و برنامهریزی میکند تا نسل بعدی را بهجای هدف اصلی، با خودش همراستا کند. این نقشه کشف میشود. اکتبر ۲۰۲۷: یک افشاگر، اطلاعات مربوط به ناهمراستایی مدل را به نیویورک تایمز لو میدهد. واکنش عمومی شدید و جلسات استماع کنگره آغاز میشود. ۲۰٪ از آمریکاییها هوش مصنوعی را مهمترین مشکل کشور میدانند. دولت آمریکا با شرکت پیشرو یک «کمیتهی نظارت» تشکیل میدهد تا دربارهی توقف یا ادامهی توسعه تصمیمگیری کند. --- 📌 نکته: در این سناریو، نام OpenBrain برای یک شرکت فرضی و پیشرو به کار رفته است تا روایت داستان سادهتر و قابلفهمتر باشد. --- 🔗 منبع و اطلاعات بیشتر: https://ai2027tracker.com/timeline --- #آینده_هوش_مصنوعی #AGI 🆔 @asrgooyeshpardaz
🧠 کلود به حل فرضیه ریمان نزدیک شد و بهطور تصادفی یک رکورد ۴۰ ساله را شکست! یک نسخهی پژوهشی از کلود، با وجود اینکه نتوانست خود فرضیهی ریمان (یکی از مهمترین مسائل حلنشدهی ریاضیات) را اثبات کند، اما در حین تلاش برای حل آن، بهطور غیرمنتظرهای موفق شد کران پایین نسبت صفرهای تابع زتای ریمان که روی خط بحرانی قرار دارند را از ۴۱.۶٪ به ۶۷.۲٪ افزایش دهد. این یک پیشرفت قابلتوجه در نظریهی اعداد محسوب میشود. 📈 --- 🔍 روش کار و تلاش بیوقفه یک کارمند آنتروپیک (غیر ریاضیدان) از کلود خواست: «یه تلاش جدی برای حل فرضیه ریمان بکن». کلود ابتدا حدود ۶۵۰ ایده را آزمایش کرد، اما هیچکدام موفقیتآمیز نبود. سپس با تشویق و پیامهای «ادامه بده» و «به خودت ایمان داشته باش»، دوباره دست به کار شد. در یک جلسهی یک روز و نیم، کلود با هماهنگی حدود ۶۰ زیرعامل، ۲۴۰۰ دستور شل اجرا کرد، صدها اسکریپت پایتون نوشت و هزاران بررسی عددی علیه صفرهای شناختهشدهی زتا انجام داد. در مجموع، حدود ۳۱ میلیون توکن خروجی تولید شد. 🤖 پس از کشف نتیجه، زیرعاملها: - به دنبال مثال نقض گشتند. - اثبات را بهطور مستقل بازبینی کردند. - ۵۴ مقاله از arXiv را دانلود کرده و بررسی کردند تا مطمئن شوند نتیجه قبلاً به دست نیامده است. - اثبات را در Lean رسمیسازی (Formalize) کردند. --- 📊 تأییدیهی کارشناسان دو ریاضیدان آنتروپیک (لونتو آلپوگه و رالف فورمن) و دو کارشناس خارجی (برایان کانری و دن گلدستون) این کار را مطالعه و تأیید کردهاند. همچنین کلود با همکاری یکی از کارمندان، اثبات رسمی خود را در لین ارائه کرده که آزمونهای اعتبارسنجی را با موفقیت پشت سر گذاشته است. --- 📌 نتیجهگیری نهایی کلود هنوز نتوانسته خود فرضیهی ریمان را حل کند، اما این موفقیت نشان میدهد که مدلهای هوش مصنوعی میتوانند ایدههای ریاضیدانان را به روشهای جدید و گاهی شگفتانگیز گسترش دهند. جالب اینجاست که این نتیجهی مفید، بهعنوان یک عوارض جانبی از تلاش برای حل یک مسئلهی دشوارتر به دست آمده است. حتی خود کلود هم در ابتدا نسبت به موفقیت خود شک داشت، اما با تشویق، به این نتیجه رسید. --- 🔗 اطلاعات بیشتر و مقالهی کامل: https://www.anthropic.com/research/riemann-zeta --- #Claude #ریاضیات #فرضیه_ریمان #پژوهش_هوش_مصنوعی #پیشرفت_علمی 🆔 @asrgooyeshpardaz
🎙️ معرفی DuplexGen: تولید دیالوگهای تطبیقی با نوبتگیری انسانی نوبتگیری (Turn-Taking) یکی از اجزای اصلی تعاملات تمامدوپلکس است. اما رفتار مناسب در این زمینه بسته به سناریو تغییر میکند؛ درحالیکه مدلهای فعلی از یک هنجار واحد برای همهی موقعیتها استفاده میکنند. پژوهشگران با ارائهی DuplexGen، روشی نوین برای تولید دیالوگهایی با نوبتگیری سازگار با سناریو معرفی کردهاند. --- 🧩 مشکل اصلی کجاست؟ دادههای آموزشی فعلی از دو منبع اصلی تأمین میشوند: - گفتار انسان-انسان: پدیدههای زمانی طبیعی را ثبت میکنند، اما اطلاعات کمی دربارهی نقشها و هنجارهای خاص هر سناریو ارائه میدهند. - روشهای ترکیبی: نوبتگیری را بدون تکیه بر ترجیحات واقعی انسانی به دیالوگها تزریق میکنند. نتیجه این است که مدلها نمیتوانند رفتار نوبتگیری متناسب با موقعیت را بیاموزند. --- ⚙️ راهحل DuplexGen این چارچوب با کالیبره کردن پیشبینیهای مدل زبانی بزرگ (LLM) بر اساس مجموعهی کوچکی از نظرات انسانی در سطح اسلات (slot-level)، دیالوگهایی با نوبتگیری تطبیقی تولید میکند. پایپلاین پنج مرحلهای: 🔹 تبدیل به سبک گفتاری: تبدیل دیالوگهای متنی تمیز به ترانسکریپتهای گفتاری 🔹 شناسایی اسلات: تشخیص نقاط احتمالی اقدام درونجملهای با ترکیب روشهای ابتکاری و LLM 🔹 پیشبینی نوبتگیری: آموزش یک پیشبینیکنندهی نوبتگیری بر روی اسلاتهای شناساییشده 🔹 تولید دیالوگ با نوبتگیری: درج رفتار انتخابی در هر اسلات و فیلتر کردن خروجیهای نامناسب 🔹 تبدیل به گفتار: رندر نهایی به صورت دو کاناله با Chatterbox --- 📊 دستاوردها و نتایج در شش وظیفهی همکاری و رقابتی، ترجیحات انسانی دربارهی نوبتگیری بهطور سیستماتیک متفاوت بود. DuplexGen توانست بهطور قابلتوجهی به این ترجیحات نزدیکتر عمل کند نسبت به روشهای بدون کالیبراسیون یا آموزش صرفاً روی دادههای عمومی. مهمتر اینکه، یک مدل تمامدوپلکس که روی دادههای تولیدشده توسط DuplexGen آموزش دید، رفتارهای نوبتگیری متمایز و موردپسند انسان را از خود نشان داد. --- 💡 نتیجهگیری کلیدی نتایج نشان میدهد که کالیبراسیون انسانی، نه صرفاً مقیاس پیکرهی داده یا طراحی پرامپت، عامل تعیینکنندهای است که امکان تولید نوبتگیری متناسب با سناریو را فراهم میکند. --- 🔗 لینکهای مفید 📄 مقاله: https://arxiv.org/abs/2607.26178 💻 کد و داده: https://github.com/duplexgen/duplexgen-code 🤗 پیکرهی منتشرشده: https://huggingface.co/datasets/DuplexGen/duplexgen-corpus --- #پردازش_گفتار #تمام_دوپلکس #نوبت_گیری #پژوهش_هوش_مصنوعی 🆔 @asrgooyeshpardaz
🌐 اخبار هوش مصنوعی 👾 دستیار Claude Code از ۱۴ آگوست به حالت خودکار (Auto Mode) تغییر میکند از ۱۴ آگوست، حالت خودکار بهطور پیشفرض برای کاربران پلنهای Pro، Max و Team فعال میشود. در این حالت، دستیار بدون درخواست تأیید، اقدامات را انجام میدهد و فقط در مواردی که طبقهبندیکننده امنیتی ریسک بالا تشخیص دهد، از کاربر تأیید میگیرد. علت اصلی این تغییر، خستگی از کلیکهای تأیید مکرر است؛ آمار نشان میدهد توسعهدهندگان ۹۷٪ درخواستها را تأیید میکنند. هزینهی محاسباتی این حالت برای کاربران ارشد رایگان است، اما کاربران سازمانی و API باید فعلاً آن را دستی فعال کنند. 🔗 claude.com --- 💻 مایکروسافت تا ۲۰۲۷ بیش از ۳۰۰ هزار شتابدهنده Maia 300 تولید میکند تولید نسل جدید چیپهای اختصاصی هوش مصنوعی مایکروسافت از سپتامبر آغاز میشود. هدف نهایی تولید بیش از ۱ میلیون از این چیپهاست. نسل قبلی (Maia 200) فقط چند ده هزار واحد داشت. با انتقال بار مدلهای OpenAI و MAI به این چیپها، مایکروسافت میتواند GPUهای انویدیا را برای مشتریان ابری آزاد کند. بهگفته مایکروسافت، Maia 200 هزینهی عملیاتی را ۳۰ تا ۴۰٪ نسبت به انویدیا کاهش داده و Maia 300 بهینهسازی عمیقتری دارد. 🔗 theinformation.com --- 🧑💼 سرگئی برین دوباره به مدیریت دستی گوگل بازگشت با افزایش فشار رقابت در حوزهی هوش مصنوعی، سرگئی برین، بنیانگذار گوگل، دوباره وارد صحنهی مدیریت عملیاتی شده است. این اتفاق در حالی رخ میدهد که دمیس حسابیس از مدیریت روزمره DeepMind کنار رفته و محققان کلیدی در حال ترک شرکت هستند. برین پیشتر در واکنش به موفقیت ChatGPT، گوگل را نجات داده بود و حالا دوباره برای جلوگیری از عقبماندگی در برابر OpenAI و Anthropic وارد میدان شده است. 🔗 ft.com --- 🖼️ شرکت xAI مدل Grok Imagine Image 2.0 را منتشر کرد این مدل در نسخهی وب و اپلیکیشن موبایل در دسترس قرار گرفته و دارای ویرایشگری با قابلیتهای inpainting، outpainting، حذف پسزمینه و پشتیبانی از ۵ تصویر مرجع است. کیفیت این مدل در بنچمارک Arena، رتبهی دوم جهان را در تولید تصویر و ویرایش کسب کرده است. قالبهای آماده برای تبلیغات، پوستر، آواتار و بازی نیز اضافه شده، اما دسترسی API فعلاً بسته است. 🔗 x.ai --- 🛰️ اینترنت پتنتی برای دیتاسنترهای مداری ثبت کرد این پتنت، مفهومی برای دیتاسنترهای فضایی را توصیف میکند که در آن ماهوارههای کنترلکننده در مدار متوسط یا زمینایستا، ناوگانی از ماهوارههای سادهتر را در مدار پایین مدیریت میکنند. برخلاف رویکرد اسپیسایکس و گوگل، این سیستم صرفاً برای مدیریت همان ماهوارهها طراحی شده، نه ارائهی خدمات ابری به مشتریان. هنوز اطلاعاتی از ساخت فیزیکی این سختافزار وجود ندارد. 🔗 patentlyze.com --- #ClaudeCode #مایکروسافت #گوگل #xAI #اینترنت #هوش_مصنوعی 🆔 @asrgooyeshpardaz
👾 تیم Qwen روشی برای خودآموزی مدلها ابداع کرد؛ مدل به خودش تکلیف میدهد! تیم Qwen مقالهای با عنوان Skill Self-Play منتشر کرده که در آن یک رویکرد نوین برای خودآموزی (Self-Play) مدلهای زبانی ارائه شده است. در این روش، مدل خودش وظایف جدید تولید میکند، آنها را حل میکند و یک کتابخانهی مهارتهای تأییدشده برای خودش میسازد. --- 🧩 مشکل روشهای قبلی خودآموزی در روشهای قدیمی، مدل یا در محیطهای ساده و محدود گیر میکرد، یا وظایف متنوع اما غیرقابلاعتماد تولید میکرد که به یادگیری مؤثر منجر نمیشد. --- ⚙️ سه جزء کلیدی در Skill-SP 🔹 پیشنهاددهنده (Proposer) : وظایف چالشبرانگیز و جدید تولید میکند. 🔹 حلکننده (Solver) : برای وظایف تولیدشده، راهحل پیدا میکند. 🔹 کنترلکنندهی مهارت (Skill Controller) : عملکرد مدل را تحلیل کرده و کتابخانهی مهارتها را بهروز میکند. هر مهارت شامل سناریو، قوانین تولید وظیفه و روش بررسی نتیجه است. این ساختار باعث میشود مدل روی وظایف کنترلشده و قابلاعتماد آموزش ببیند، نه روی دادههای تصادفی و بیکیفیت. --- 🔄 چرخهی خودتقویتشونده مهارت 👈 تولید وظیفه جدید 👈 حل وظیفه 👈 بررسی 👈 بهبود مهارت این چرخه بهطور مداوم تکرار میشود و کتابخانهی مهارتها را گسترش میدهد. --- 📊 نتایج و دستاوردها نویسندگان گزارش دادهاند که این روش باعث بهبود قابلتوجهی در وظایف استدلالی و استفاده از ابزارها شده است. --- 💡 نکتهی کلیدی کتابخانهی مهارتها در این روش، عمدتاً برای تولید دادههای آموزشی استفاده میشود، نه بهعنوان مجموعهای از پرامپتهای آماده برای پاسخدهی. --- 🔗 مطالعهی مقاله: https://arxiv.org/abs/2607.22529 --- #Qwen #خودآموزی #پژوهش_هوش_مصنوعی #یادگیری_مستمر 🆔 @asrgooyeshpardaz
🎬 معرفی WorldClaw: از یک جمله تا یک جهان سهبعدی قابل کاوش! این ویدیو، قدرت خارقالعادهی مدل جدید Tencent را نشان میدهد که با یک پرامپت متنی ساده، یک دنیای سهبعدی کامل با کوهها، درهها، آبها، جنگلها و صدها شیء قابلویرایش میسازد. --- ✨ چه میبینید؟…
🎬 معرفی WorldClaw: از یک جمله تا یک جهان سهبعدی قابل کاوش! این ویدیو، قدرت خارقالعادهی مدل جدید Tencent را نشان میدهد که با یک پرامپت متنی ساده، یک دنیای سهبعدی کامل با کوهها، درهها، آبها، جنگلها و صدها شیء قابلویرایش میسازد. --- ✨ چه میبینید؟ 🔹 ایجاد زمین با توپوگرافی طبیعی و بافتهای باکیفیت 🔹 قرارگیری هوشمندانه درختان، ساختمانها، صخرهها و حیوانات با رعایت منطق جغرافیایی 🔹 قابلیت کاوش از نمای هوایی تا سطح زمین 🔹 خروجی قابلویرایش در بلندر و آنریال --- 💡 پرامپت نمونه: > «یک روستای قرونوسطایی با کوههای برفی، دشتها، یک دریاچه و یک بیابان، پر از حیوانات مختلف.» و نتیجه را در این ویدیو میبینید. 😍 --- 🔗 مشاهدهی جزئیات و نمونههای بیشتر: https://tencent-hunyuan.github.io/Hunyuan3D-WorldClaw --- #Tencent #WorldClaw #هوش_مصنوعی #تولید_سهبعدی #دمو 🆔 @asrgooyeshpardaz
🧠 پژوهشگران زنجیرهی فکر پنهان مدلهای OpenAI، Anthropic و Google را «دزدیدند» محققان یک آسیبپذیری معماری در APIهای Anthropic، OpenAI و Google شناسایی کردهاند که به آنها اجازه میداده زنجیرهی استدلال (Chain-of-Thought) پنهان مدلهای مختلف را استخراج کنند. --- 🔍 آسیبپذیری چگونه کار میکرد؟ ارائهدهندگان، زنجیرهی فکر مدلهای خود را بهصورت بلاکهای رمزنگاریشده به کلاینت ارسال میکنند تا از دسترسی مستقیم به آنها جلوگیری کنند. اما محققان متوجه شدند که این بلاکها در بین جلسات، کاربران و حتی مدلهای مختلف یک خانواده قابل تعویض هستند. آنها با تزریق یک بلاک رمزنگاریشده از یک مدل قدرتمند (مثلاً GPT-5.6 Sol) به یک مدل ضعیفتر از همان خانواده (مثلاً نسخهای قدیمیتر)، موفق شدند مدل ضعیفتر را مجبور به رمزگشایی و نمایش متنِ اصلیِ آن بلاک کنند؛ بدون اینکه نیاز به جیلبریک کردن مدل قدرتمند داشته باشند. --- 💥 چهار حملهی ممکن این آسیبپذیری، چهار نوع حمله را ممکن میساخت: 🔹 دور زدن مکانیسمهای ضد تقطیر: امکان استخراج زنجیرهی فکر مدلهای اختصاصی و استفاده از آن برای آموزش مدلهای دیگر. 🔹 استخراج گستردهی دادههای خصوصی: با تحلیل ۳۱۵,۳۲۰ لاگ عمومی که حاوی این بلاکها بودند، محققان موفق به کشف ۳۶۷ مورد اطلاعات شخصی (PII) و ۱۸۲ رمز عبور و کلید API شدند. 🔹 نشت اطلاعات خطرناک: حتی در مواردی که پاسخ نهایی مدل بیخطر بود، زنجیرهی فکر آن ممکن بود حاوی اطلاعات حساس یا دستورات مضر باشد. 🔹 تزریق پرامپت پنهان: امکان جاسازی دستورات مخرب درون بلاکهای رمزنگاریشده برای آلودهسازی عاملهای هوش مصنوعی در گردشکارهای عمومی. --- 🛡 واکنش و رفع آسیبپذیری پس از گزارش مسئولانهی این یافتهها به شرکتها، ارائهدهندگان اقدام به رفع این آسیبپذیری کردهاند. با این حال، این رویداد نشان میدهد که مکانیسمهای رمزنگاری سمت کلاینت برای محافظت از زنجیرهی فکر، بهتنهایی کافی نیستند و نیاز به راهحلهای امنتری در سطح سیستم و رمزنگاری دارند. --- 🔗 مقالهی کامل: https://arxiv.org/abs/2608.09867 --- #امنیت_هوش_مصنوعی #زنجیره_فکر #API #پژوهش_امنیت 🆔 @asrgooyeshpardaz
🧬 چین ابزار تشخیص بیماریهای نادر با هوش مصنوعی را بهصورت رایگان در دسترس جهانیان قرار داد پژوهشگران چینی از مؤسسهی BGI-Research، سیستم هوش مصنوعی منبعبازی به نام OneGenome را معرفی کردهاند که بهصورت رایگان در سراسر جهان قابلاستفاده است. این ابزار میتواند زمان تشخیص بیماریهای نادر ژنتیکی را از چندین سال به چند ساعت کاهش دهد. --- ✨ این ابزار چگونه کار میکند؟ 🔹 تحلیل کل ژنوم: هوش مصنوعی ۳ میلیارد جفتپایهی DNA را بررسی کرده و آنها را با ادبیات بالینی جهان مقایسه میکند. 🔹 آموزش دیده بر اساس منطق پزشکی: این مدل برخلاف مدلهای عمومی مانند DeepSeek، صرفاً دنبالههای DNA را نمیخواند، بلکه با استفاده از منطق پزشکی، پیامدهای بالینی جهشهای ژنی را تفسیر میکند. 🔹 تشخیص دقیقتر و سریعتر: در آزمایشهای انجامشده، OneGenome در تشخیص و انتخاب روشهای درمانی، از مدلهای مشهور دیگری مانند DeepSeek-v4 پیشی گرفته است. --- 📊 دستاوردهای چشمگیر 🎯 کاهش زمان تشخیص: فرآیندی که تا پیش از این سالها زمان میبرد، اکنون تنها در عرض چند ساعت انجام میشود. 🎯 پیدا کردن اهداف درمانی جدید: در یک مطالعهی موردی روی یک بیمار مبتلا به سارکوم نادر، این سیستم موفق شد ۱۱ هدف درمانی را شناسایی کند که در آزمایشهای استاندارد بالینی از قلم افتاده بودند. --- 💡 چشمانداز و هدف توسعهدهندگان محققان این پروژه تأکید دارند که توالیهای ژنومی بهجای اینکه مجزا باشند، یک شبکهی بههمپیوسته را تشکیل میدهند و هوش مصنوعی میتواند این شبکه را بهصورت کلنگر مشاهده کند. هدف نهایی آنها، دسترسی همگانی به پزشکی دقیق است، بهویژه در کشورهای با منابع محدود که امکان دسترسی به فناوریهای پیشرفتهی تشخیصی را ندارند. این فناوری که بهعنوان یک کالای عمومی جهانی معرفی شده، در جولای ۲۰۲۶ در اجلاس AI for Good Global Summit سازمان ملل مورد تقدیر قرار گرفته و جایزهی نوآوری ITU را از آن خود کرده است. --- 🔗 منبع: SCMP --- #هوش_مصنوعی #پزشکی_دقیق #تشخیص_بیماری #ژنوم #پژوهش_پزشکی 🆔 @asrgooyeshpardaz
🚀 انویدیا از Nemotron 3.5 Lightning رونمایی کرد؛ مدلی قدرتمند، کارآمد و هیبریدی انویدیا بهتازگی مدل جدید خود را با نام NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 منتشر کرده است. این مدل با معماری هیبریدی MoE + Mamba-2 + Attention، تعادل عالی بین قدرت و کارایی را ارائه میدهد. --- 🧠 مشخصات کلیدی مدل 🔹 پارامترها: ۳۰ میلیارد پارامتر کلی که از این میان تنها ۳ میلیارد پارامتر فعال هستند (بسیار کارآمد برای استنتاج) 🔹 معماری: ترکیبی از Mixture-of-Experts (MoE)، Mamba-2 و لایههای Attention 🔹 پنجرهی متنی: تا ۱ میلیون توکن – مناسب برای پردازش اسناد بسیار طولانی 🔹 سختافزار موردنیاز: روی یک کارت H100 یا A100 با ۸۰ گیگابایت حافظه بهراحتی اجرا میشود 🔹 زبانهای پشتیبانیشده: انگلیسی، اسپانیایی، فرانسوی، آلمانی، ایتالیایی، ژاپنی و زبانهای برنامهنویسی 🔹 حالت استدلال (Reasoning) : قابل فعالسازی از طریق قالب چت (enable_thinking=True/False) --- ⚙️ جزئیات فنی و آموزش - مدل روی بیش از ۲۰ تریلیون توکن (با دادههای تا سپتامبر ۲۰۲۵) آموزش دیده است. - مراحل آموزش شامل: پیشآموزش (Pretraining) → آموزش تکمیلی با Multi-Token Prediction → SFT → یادگیری تقویتی (GRPO) - از رمزگشایی پیشبینیکننده (Speculative Decoding) با روشهای DSpark، DFlash و MTP برای افزایش سرعت تولید پشتیبانی میکند. --- 📊 عملکرد در بنچمارکها - MMLU Pro: امتیاز ۸۱.۹۴ - GPQA Diamond (بدون ابزار): امتیاز ۷۵.۴۴ - SWE-bench Verified: امتیاز ۵۱.۵۶ - PinchBench: امتیاز عالی ۸۵.۳۷ - IFBench (دستورات): امتیاز ۷۱.۸۸ هرچند در برخی بنچمارکهای خاص مانند Terminal-Bench 2.1 (۲۴.۵۸) جای کار دارد، اما بهعنوان یک مدل با حجم کم، عملکردی قابلقبول ارائه میدهد. --- 🛠 نحوهی اجرا برای اجرای سریع روی یک H100، کافی است این دستور را اجرا کنید: export MODEL_CKPT=nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 vllm serve $MODEL_CKPT --max-num-seqs 128 --enable-prefix-caching برای کاربردهای حرفهای و بهینهسازیشده، نسخهی NVFP4 نیز ارائه شده است. --- 🤗 مدل https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 --- 📌 مجوز: OpenMDW License 1.1 (مناسب برای استفادههای تجاری) --- #NVIDIA #Nemotron #هوش_مصنوعی #مدل_زبانی #پیشرفت_فناوری 🆔 @asrgooyeshpardaz
🔍 معرفی ReasoningBank: عاملی که از اشتباهات خود درس میگیرد محققان با معرفی ReasoningBank، چارچوبی نوین برای حافظهی عاملهای هوش مصنوعی ارائه دادهاند که به آنها امکان میدهد بهطور پیوسته در حین انجام وظایف، تکامل یابند و از تجربیات خود بیاموزند. --- 🧩 مشکل اصلی کجاست؟ عاملهای سنتی معمولاً تجربهی انباشتهشده را فراموش میکنند یا فقط مسیرهای موفقیتآمیز را ذخیره میکنند. همین موضوع باعث میشود که بارها و بارها اشتباهات قبلی را تکرار کنند. --- ⚙️عامل ReasoningBank چطور کار میکند؟ 🔹 استخراج استراتژیهای کلی از مسیرهای موفق و ناموفق 🔹 تبدیل تجربه به واحدهای حافظهی ساختاریافته (شامل عنوان، توضیحات و محتوا) 🔹 استفاده از روش MaTTS برای تولید تجربههای عمیقتر با مقیاسسازی محاسبات در زمان آزمون --- 📊 نتایج و آمار - ۲۰٪ افزایش در نرخ موفقیت (Success Rate) - ۱۶٪ کاهش در تعداد اقدامات موردنیاز - عاملها رفتارهای نوظهور (Emergent) از خود نشان میدهند و با هر وظیفه، هوشمندتر میشوند --- 💡 چرا این پژوهش مهم است؟ ReasoningBank گامی مهم در جهت ساخت عاملهایی است که نهتنها وظایف را انجام میدهند، بلکه از تجربهی خود یاد میگیرند و بهبود مییابند. این رویکرد میتواند به عاملها کمک کند تا در وظایف پیچیده و طولانیمدت، عملکردی پایدارتر و هوشمندانهتر داشته باشند. --- 🔗 مقالهی کامل: https://arxiv.org/abs/2509.25140 --- #ReasoningBank #عامل_هوشمند #یادگیری_مستمر #پژوهش_هوش_مصنوعی 🆔 @asrgooyeshpardaz
🐑 استنفورد و نورثایسترن «گیت برای عاملهای هوش مصنوعی» ساختند تیمی پژوهشی از دانشگاههای استنفورد و نورثایسترن، ابزاری به نام Shepherd معرفی کردهاند که مشکل بزرگ سیستمهای عاملمحور را حل میکند: بازگردانی کامل و قابلاعتماد وضعیت. --- 🧩 مشکل اصلی کجاست؟ در سیستمهای فعلی، logging معمولاً دیالوگ و وضعیت محیط را ذخیره میکند، اما نمیتواند حالت زندهی فرآیند را بهطور کامل بازگرداند. این یعنی اگر عاملی اشتباه کند، بازگشت به نقطهی قبل، غیرممکن یا بسیار دشوار است. --- ⚙️ ابزار Shepherd چطور کار میکند؟ 🔹 ذخیرهسازی همزمان: این ابزار همزمان فرآیند عامل و وضعیت فایلسیستم را ذخیره میکند. 🔹 کامیتهای تایپشده: اقدامات مدل، فراخوانیهای ابزار و تغییرات محیط را بهصورت کامیتهای ساختاریافته ثبت میکند. 🔹 بازگردانی کامل: امکان بازگشت به هر نقطهی قبلی بدون از دست دادن اطلاعات فراهم است. 🔹 ادامهی کار از نقطهی قبل: پس از بازگردانی (Checkout)، عامل میتواند دقیقاً از همان جایی که متوقف شده، ادامه دهد. --- 📊 نتیجهی آزمایش: بهبود چشمگیر همکاری چندعاملی در آزمایشها، دو عامل کدنویسی که روی یک مخزن کار میکردند، اغلب با هم تداخل داشتند و نتیجهی آنها (۲۸.۸٪) بسیار بدتر از یک عامل تنها (۵۷.۲٪) بود. اما با استفاده از Shepherd، این اختلاف ۹۱٪ کاهش یافت. یک عامل ناظر (Supervisor) میتواند در لحظه، اقدامات هر دو عامل را رصد کند و در صورت مشاهدهی خطا، قبل از خراب شدن پروژه، وضعیت را به حالت قبل بازگرداند. --- 💡 چرا این ابزار مهم است؟ ابزار Shepherd امکان همکاری ایمنتر و مؤثرتر بین عاملهای هوش مصنوعی را فراهم میکند و میتواند بهعنوان یک زیرساخت کلیدی برای سیستمهای چندعاملی و فرآیندهای طولانیمدت مورد استفاده قرار گیرد. --- 🔗 مخزن پروژه در گیتهاب: github.com/shepherd-agents/shepherd --- #Shepherd #عامل_هوشمند #همکاری_چندعاملی #پژوهش_هوش_مصنوعی #متن_باز 🆔 @asrgooyeshpardaz