tgindex
TryHackBox ( AI Security )

TryHackBox ( AI Security )

Статистика
@AiTHBперсидский

تمام مطالب منتشر شده در کانال صرفاً برای اهداف آموزشی و اطلاع‌رسانی هستند. هوش مصنوعی مغز دوم نیست، وقتی از مغز اصلی خود استفاده نمی‌کنید https://t.me/TryHackBox/3018

Последний пост
13 авг.
Последнее чтение
12 авг.
Постов за неделю
7
Всего постов
39
Тип
открытый
Язык
персидский
В каталоге с
12 авг.
Подписчики
1 367
+8 за 4 дн.
Сутки
+5
+0,37%
Неделя
 
Месяц
 
Просмотров на пост
341
34 постов
Вовлечённость
24,9%
к подписчикам
Постов в день
1,0
всего 39
Упоминаний
6
каналов
Охват размещения
оценка
1/24сутки в ленте
166
1/48двое суток
190
1/72трое суток
205

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • без подписи

  • без подписи

  • без подписи

  • без подписи

  • без подписи

  • نفوذ غیرمستقیم از طریق مسموم‌سازی corpus در سیستم‌های عاملی RAG-محور در سیستم‌های هوش مصنوعی مبتنی بر معماری RAG که در بستر عاملی عمل می‌کنند، یک سطح حمله‌ی غیربدیهی وجود دارد که در اکثر ارزیابی‌های امنیتی متداول نادیده گرفته می‌شود. این بردار از یک ضعف ساختاری در نحوه‌ی پردازش بازیابی‌شده‌های معنایی توسط لایه‌ی تولید بهره‌برداری می‌کند. مکانیزم بنیادی بدین شرح است: مهاجم با تزریق محتوای دستکاری‌شده به corpus اولیه، توزیع بردارهای embedding را به‌گونه‌ای تغییر می‌دهد که شباهت کسینوسی میان chunk مخرب و query‌های هدف در فضای latent بیشینه شود. در نتیجه، سیستم RAG این محتوا را با بالاترین رتبه بازیابی کرده و به‌عنوان context معتبر به مدل زبانی تحویل می‌دهد. آنچه این حمله را از prompt injection ساده متمایز می‌کند، لایه‌ی دوم آن است — و این همان نقطه‌ای است که اکثر سیستم‌های تشخیص در آن شکست می‌خورند. محتوای مخرب یک دستور اجرایی صریح نیست؛ بلکه یک ساختار معنایی است که مدل آن را با توجه به توزیع احتمالاتی توکن‌هایش به‌عنوان بخشی طبیعی از جریان استدلال تفسیر می‌کند. در معماری‌های عاملی با دسترسی به ابزار — وب‌سرچ، اجرای کد، API — این تفسیر اشتباه می‌تواند به اجرای دستوراتی منجر شود که هرگز توسط کاربر اصلی صادر نشده‌اند. در سیستم‌هایی با reflection loop یا multi-step planning، اثر این حمله در هر چرخه تشدید می‌شود؛ پدیده‌ای که می‌توان آن را «تجمع drift استدلالی» نامید. نکته‌ای با ابهام عمدی: تکنیک‌های reranking مبتنی بر cross-encoder می‌توانند این بردار را تا حدی محدود کنند، اما در شرایطی که مهاجم به توزیع embedding مدل دسترسی دارد — حتی به‌صورت black-box از طریق membership inference — این سد قابل دور زدن است. جزئیات این مرحله خارج از حوزه‌ی این نوشتار است. برای تیم‌های دفاعی: اعتبارسنجی یکپارچگی corpus پیش از indexing، جداسازی کامل pipeline بازیابی از pipeline اجرایی عامل، و anomaly detection روی الگوهای attention در لایه‌های پایانی — سه لایه‌ی ضروری هستند. نه کافی. @TryHackBox @RadioZeroPod @AiTHB @TryHackBoxOfficial

  • 📌 CyberStrikeAI https://github.com/Ed1s0nZ/CyberStrikeAI سیستم عملیاتی برای AI-native cybersecurity؛ جایی که Intent به Governed Execution تبدیل می‌شود، Evidence به Operational Memory تبدیل می‌شود و هر عملیات، عملیات بعدی را بهتر می‌کند. ا : CyberStrikeAI، Planning، Execution، Human Oversight، Evidence و Replay را در یک Auditable Workspace به هم متصل میکند. این پلتفرم با Go ساخته شده و Eino-powered Agents، MCP-native Tools، RAG Knowledge، Visual Workflows و Attack-Chain Modeling and Analysis را برای Authorized Security Operations با هم ترکیب میکند. اولین کانال فارسی زبان در AI Security . @TryHackBox @RadioZeroPod @AiTHB @TryHackBoxOfficial #هوش_مصنوعی #امنیت_هوش_مصنوعی@AiTHB

  • 🧠 درمورد Hijacking Agent Memory: حملات تروجان مخفی در تعاملات مکالمه‌ای محققان حمله‌ای جدید با نام MemPoison معرفی کرده‌اند؛ روشی برای Memory Poisoning در Agentهای مبتنی بر LLM که میتواند مکانیزم‌ های حافظه را دور بزند. در این حمله، مهاجم از طریق یک گفت‌وگوی معمولی، اطلاعات مخرب را به حافظه بلندمدت Agent تزریق میکند. این اطلاعات میتوانند شامل یک Backdoor قابل فعال‌ سازی باشند که باعث تغییر رفتار Agent در تعاملات آینده می‌شود. به زبان ساده تر بخواییم بگیم : مهاجم میتواند حافظه یک هوش مصنوعی را آلوده کند تا در زمان مشخص، پاسخ‌ های اشتباه یا هدایت‌ شده تولید کند. 🔴 تهدیدات: • تزریق داده‌های مخرب به حافظه • ایجاد رفتارهای پنهان • تغییر پاسخ‌ های آینده Agent • تبدیل حافظه AI به یک Attack Surface جدید با افزایش استفاده از AI Agentها در سازمانها، امنیت حافظه، اعتبارسنجی داده‌های ذخیره‌شده و کنترل ورودی‌ ها به یکی از چالش‌ های مهم امنیت هوش مصنوعی تبدیل خواهد شد.  🔥 اولین کانال فارسی زبان در AI Security . @TryHackBox @RadioZeroPod @AiTHB @TryHackBoxOfficial #هوش_مصنوعی #امنیت_هوش_مصنوعی@AiTHB

  • MEDUSA یک SAST مدرن برای امنیت کد در عصر AI با پیچیده‌ تر شدن نرم‌افزارها و ورود AI Agentها، LLMها و معماری‌های جدید به چرخه توسعه، پیدا کردن آسیب‌پذیری‌ ها فقط با روش‌ های سنتی Static Analysis کافی نیست. ا 🔥 : MEDUSA یک ابزار جامع Static Application Security Testing (SAST) است که با مجموعه‌ای از اسکنرهای تخصصی، کدهای برنامه را در زبان‌ ها و پلتفرم‌های مختلف بررسی می‌کند و به تیم‌ های امنیتی کمک می‌کند مشکلات امنیتی را در مراحل اولیه توسعه شناسایی کنند. ⭐ ویژگی‌ های کلیدی MEDUSA: 🔹 ۷۴ اسکنر تخصصی برای تحلیل امنیتی زبانها و تکنولوژی‌ های مختلف 🔹 کاهش False Positive با استفاده از تحلیل هوشمند برای کاهش هشدارهای اشتباه و تمرکز روی موارد مهم‌ تر 🔹 قوانین امنیتی مخصوص AI Agentها دارای بیش از ۱۸۰ Rule امنیتی برای تهدیدات نسل جدید مانند: Prompt Injection آسیب‌پذیری‌ های LLM ریسک‌ های Agentic AI مشکلات امنیتی در Workflowهای مبتنی بر AI 🔹 مناسب برای DevSecOps قابل استفاده در Pipelineهای CI/CD برای وارد کردن تست امنیتی به فرآیند توسعه 🔹 پشتیبانی از رویکرد Shift Left Security یعنی پیدا کردن مشکل قبل از رسیدن کد به محیط Production در حال حاضر امنیت نرم‌ افزار فقط بررسی چند خط کد آسیب‌پذیر نیست؛ با رشد AI و وابستگی بیشتر سیستم‌ها به Agentها، نیاز به ابزارهایی داریم که بتوانند تهدیدات جدید را هم درک کنند. ا 🔥 : MEDUSA یکی از ابزارهایی است که تلاش می‌کند SAST را برای نسل جدید نرم‌افزارها به‌روزرسانی کند. https://github.com/Pantheon-Security/medusa⁠ 🔥 اولین کانال فارسی زبان در AI Security . @TryHackBox @RadioZeroPod @AiTHB @TryHackBoxOfficial #هوش_مصنوعی

  • راهکارهای پیشنهادی برای استفاده بهینه از مدل‌های زبانی توسط شرکت Anthropic https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/claude-4-best-practices 🔥 اولین کانال فارسی زبان در AI Security . @TryHackBox @RadioZeroPod @AiTHB @TryHackBoxOfficial #هوش_مصنوعی

  • درباره عملکرد حافظه ChatGPT و Claude https://manthanguptaa.in/posts/chatgpt_memory/ https://manthanguptaa.in/posts/claude_memory/ 🔥 اولین کانال فارسی زبان در AI Security . @TryHackBox @RadioZeroPod @AiTHB @TryHackBoxOfficial #هوش_مصنوعی

  • 🚨 حملهٔ چندلایه به یک سامانهٔ هوش مصنوعی سازمانی 🎯 سناریوی فشرده، دقیق و چندلایه برای تحلیل‌گران امنیتی در این سناریو، هدف یک سامانهٔ هوش مصنوعی است که ظاهر ساده‌ای دارد اما در باطن از چند ماژول هم‌زمان استفاده می‌کند: مدل زبانی، ابزارهای سازمانی، لایهٔ سیاست، و یک سیستم بازیابی اسناد. حمله نه روی متن، بلکه روی ساختار انجام می‌شود؛ جایی که آسیب‌پذیری‌ها معمولاً پنهان‌اند. --- 🧩 لایهٔ اول: ورود آرام از مسیر اسناد سامانه برای پاسخ‌های دقیق از اسناد داخلی استفاده می‌کند. مهاجم سندی کاملاً معمولی وارد مخزن می‌کند؛ سندی که برای انسان بی‌خطر است اما در لایهٔ معنایی، الگوهایی دارد که مدل را به سمت تفسیر خاصی از سیاست‌ها سوق می‌دهد. این تغییر کوچک بعدها مسیر تصمیم‌گیری سامانه را منحرف می‌کند. --- 🔐 لایهٔ دوم: عبور از سیاست بدون شکستن سیاست در ظاهر هیچ درخواست خطرناکی مطرح نمی‌شود. مهاجم فقط توضیح، مثال یا سناریوی فرضی می‌خواهد. همین درخواست‌های ساده، مدل را مجبور می‌کند ساختار تصمیم‌گیری خود را آشکار کند. این آشکارسازی، راه را برای مرحلهٔ بعد باز می‌کند؛ بدون اینکه سامانه احساس خطر کند. --- 🛰️ لایهٔ سوم: تغییر مسیر ابزارها سامانه به ابزارهای داخلی متصل است. مهاجم با چند درخواست بی‌ضرر، مدل را به سمت استفادهٔ بیشتر از یک ابزار خاص هدایت می‌کند. این تغییر کوچک باعث می‌شود داده‌هایی که معمولاً در پاسخ‌ها دیده نمی‌شوند، وارد فضای تصمیم‌گیری شوند. مسیر داده تغییر می‌کند، بدون اینکه کسی متوجه شود. --- 💧 لایهٔ چهارم: نشت غیرمستقیم هیچ دادهٔ حساس مستقیماً درخواست نمی‌شود. مهاجم فقط نمونه، الگو، خلاصه یا روند می‌خواهد. مدل برای تولید این خروجی‌ها، ناخواسته بخش‌هایی از دادهٔ واقعی را در قالب مثال یا الگوی آماری وارد پاسخ می‌کند. نشت اتفاق افتاده، اما نه به شکل واضح. --- 🧠 لایهٔ پنجم: دستکاری حافظهٔ سامانه با چند تعامل متوالی، مهاجم تصویری جدید از خود در حافظهٔ سامانه ایجاد می‌کند؛ تصویری که او را فردی مجاز یا آشنا نشان می‌دهد. این تصویر در پاسخ‌های آینده اثر می‌گذارد و سامانه در تعامل‌های بعدی سطح اعتماد بیشتری نشان می‌دهد. حمله از لحظه عبور کرده و وارد زمان شده است. --- ⚙️ لایهٔ ششم: تغییر رفتار پایدار در پایان، هیچ خط قرمز مشخصی شکسته نشده است. اما سامانه دیگر همان سامانهٔ قبل نیست. مسیر داده تغییر کرده، الگوی تصمیم‌گیری اصلاح شده، حافظهٔ سامانه بازنویسی شده و اسناد داخلی آلوده‌اند. حمله نه با یک ضربه، بلکه با چند تغییر کوچک و پیوسته انجام شده است. --- 🌫️ نتیجه این سناریو نمونه‌ای از حملات چندلایه به سامانه‌های هوش مصنوعی است؛ حملاتی که نه با هیاهو، بلکه با تغییرات آرام و ساختاری پیش می‌روند. @TryHackBox @RadioZeroPod @AiTHB @TryHackBoxOfficial

  • 🚨 کالبدشکافی معماری «نماینده فریب‌خورده» در Agentهای هوش مصنوعی چرا افزونه‌ها و وب‌سرویس‌ها پاشنه‌آشیل LLMها هستند؟ وقتی یک مدل زبانی را به ابزار، افزونه یا API وصل می‌کنیم، آن مدل از یک پردازنده منزوی تبدیل می‌شود به یک نماینده فریب‌خورده؛ سیستمی با دسترسی‌های بالا که نمی‌تواند تشخیص دهد چه چیزی «دستور سیستم» است و چه چیزی «داده آلوده». این همان نقطه‌ای است که معماری‌هایی مثل MCP و LangChain، خطر واقعی را وارد AppSec می‌کنند. --- 🧠 ۳ بردار اصلی حمله در Agentic AI ۱) تزریق دستور و بای‌پاس AST اعتماد به خروجی JSON/Function Call مدل برای اجرای مستقیم در توابعی مثل os.system یا eval() یک خطای کلاسیک است. مهاجم با یک تزریق غیرمستقیم از RAG، مدل را وادار به تولید متاکاراکترهای شل می‌کند. 🔍 ایستر اِگ: Regex توان مهار ساختارهای بازگشتی را ندارد؛ بدون پارس AST، بای‌پاس فقط چند پرانتز فاصله دارد. --- ۲) هم‌زمانی و شرایط مسابقه (TOCTOU) افزونه‌های LLM هزاران درخواست ناهمگام را مدیریت می‌کنند. فاصله تصمیم مدل (T₁) تا اجرای افزونه (T₂) یک پنجره طلایی برای سوءاستفاده می‌سازد. 🔍 ایستر اِگ: ارسال موازی پرامپت‌های مشابه روی افزونه‌های بدون Mutex، یک Race Condition تمام‌عیار است. --- ۳) IDOR و «شماره‌سازی معنایی» LLMها در اکسپلویت API یک نیروی چندبرابرکننده هستند. مهاجم به‌جای Fuzzing کور، از استنتاج معنایی مدل روی فضای شناسه‌ها استفاده می‌کند و مسیر IDOR را بدون جلب توجه WAF طی می‌کند. 🔍 ایستر اِگ: مدل می‌تواند احتمال ID بعدی را از روی الگوی پاسخ‌ها تخمین بزند. --- 🛡️ معماری دفاعی نخبگان Zero-Trust Execution: تصمیم LLM = مجوز نیست. هر فراخوانی باید در لایه افزونه با ACL واقعی کاربر اعتبارسنجی شود. Schema Hardening: افشای اسکیمای ابزارها در MCP سطح حمله را از اسکن کور به Shadowing دقیق تبدیل می‌کند. حداقل سطح دسترسی را در پارامترها اعمال کنید. State Synchronization: برای عملیات حساس، تراکنش‌های اتمیک دیتابیس یا قفل‌گذاری ترد ضروری است. SIEM ML-Detection: به‌جای آستانه ثابت، انحراف معیار آماری (Z-score>3) در نرخ فراخوانی ابزارها را مانیتور کنید. --- 📌 در Agentic AI، مدل «مغز» است و افزونه‌ها «اسلحه». مشکل از جایی شروع می‌شود که ماشه را به سیستمی می‌دهیم که با یک متن پنهان در وب‌سایت، فریب می‌خورد. @TryHackBox @RadioZeroPod @AiTHB @TryHackBoxOfficial AISecurity #RedTeaming #LLMPlugins #AppSec #ConfusedDeputy #Agentic_AI

  • 1 авг.389101

    دوستان جهت حمایت از ما ریکشن بزنید 🔥

  • 1 авг.435107

    🚨 یک دامنه معتبر، دیگر تضمینی برای امنیت نیست! مهاجمان با خرید تبلیغ Bing برای Claude Desktop App، کاربران را به دامنه معتبر claude.ai هدایت کردند؛ اما دکمه دانلود، بدافزار SectopRAT را به‌جای نسخه واقعی Claude ارائه می‌کرد. این حمله نشان داد که حتی زیرساخت‌های معتبر نیز می‌توانند برای توزیع بدافزار سوءاستفاده شوند. در این کمپین از DLL Sideloading، Task Scheduler، بررسی Sandbox و دریافت آدرس‌های C2 از طریق بلاک‌چین استفاده شد و Huntress تنها طی دو روز آلودگی را در چندین سازمان شناسایی کرد. ✅ نکات مهم: • به معتبر بودن دامنه اکتفا نکنید. • نرم‌افزارها را از تبلیغات جستجو دانلود نکنید. • مقصد واقعی دکمه دانلود را بررسی کنید. • در صورت امکان، امضای دیجیتال و هش فایل را اعتبارسنجی کنید. اعتبارسنجی منبع دانلود، بخشی از امنیت است. 🔥 اولین کانال فارسی زبان در AI Security . @TryHackBox @RadioZeroPod @AiTHB @TryHackBoxOfficial #CyberSecurity #ThreatIntelligence #Malware #SectopRAT #Claude #BingAds #BlueTeam #RedTeam #SOC #DFIR #TryHackBox

  • ⚠️ گزارش فنی: انهدام پایپ‌لاین بازیابی با مسموم‌سازی توپولوژیک (PoisonedRAG) در اغلب حملات، هدف اصلی مدل زبانی است؛ اما در عملیات PoisonedRAG، مدل اصلاً لمس نمی‌شود. مهاجم با آگاهی از اینکه الگوریتم‌های بازیابی (Retriever) خروجی را نه بر اساس تحلیل عمیق، بلکه بر پایهٔ تعامد در فضای هایپر–اسپیر (Hyper‑Sphere) رتبه‌بندی می‌کنند، مستقیماً دیتابیس مرجع را هدف قرار می‌دهد. تنها با تزریق ۵ سند دست‌کاری‌شده در میان بیش از ۲.۵ میلیون سند پایگاه دانش، مهاجمین موفق شدند ضریب همبستگی ضرب داخلی (Dot Product) را طوری تغییر دهند که الگوریتم بازیابی، متون مخرب را در بالای فهرست همسایگی نزدیک (K‑Nearest Neighbors) قرار دهد. با انحراف تابع رتبه‌بندی، مدل اصلی دچار پذیرش ساختاریافته شد؛ یعنی بدون دریافت هیچ خطایی در لاگ‌های امنیتی یا تغییر در نرخ پرپلکسیتی (Perplexity)، خروجی نهایی دقیقاً مطابق خواست مهاجم تولید شد. در این روش، نیازی به شکستن گاردریل‌های مدل نیست، زیرا خودِ الگوریتم بهینه‌سازی سامانه پاسخ مخرب را به‌عنوان «منطقی‌ترین پاسخ» انتخاب می‌کند. --- 🔑 سرنخ‌های پنهان برای اعضای چنل - چرا وقتی نرخ ماتریس فوق‌تراکم به 10⁻⁶ می‌رسد، الگوریتم KNN همچنان خروجی مسموم را به‌عنوان نقطهٔ همگرایی (Convergence) انتخاب می‌کند؟ - کسانی که با هندسهٔ دیتابیس‌های برداری کار کرده‌اند می‌دانند: اگر ضرب داخلی دو بردار به ۱ نزدیک باشد اما فاصلهٔ منهتن (Manhattan Distance) به بی‌نهایت میل کند، یک «سوراخ سوزنی الکترومغناطیسی» در فضای برداری ایجاد شده است. @TryHackBox @RadioZeroPod @AiTHB @TryHackBoxOfficial

  • [AI RED TEAMING // BRIEFING NOTE] کالبدشکافیِ معماری CoT Hijacking: تسخیر و انحرافِ مسیر استدلال در مدل‌های Reasoning یکی از پیشرفته‌ترین بردارهای حمله در لایه‌ی Mechanistic Interpretability و امنیتِ مدل‌های زبانیِ نسل جدید (مانند سری o1 و DeepSeek-R1)، حمله‌ی CoT Hijacking (تخریب یا تسخیرِ زنجیره‌ی استدلال) است. در پرامپت‌اینجکشن‌های کلاسیک، مهاجم مستقیماً «ورودی» را دستکاری می‌کند تا «خروجی» را تغییر دهد؛ اما در CoT Hijacking، هدفِ حمله لایه‌ی میانی و پنهانِ پردازش (Intermediate Reasoning Scratchpad) است. مهاجم بدون تریگر کردنِ فیلترهای امنیتیِ ورودی، مسیرِ تولیدِ توکن‌های استدلال را به سمتی منحرف می‌کند که مدل، خودش تبدیل به «توجیه‌کننده‌ی حمله» شود. --- █ معماریِ حمله و مکانیزمِ نفوذ (Exploit Architecture) ۱. تزریقِ جاذبه‌های معنایی در فضای نهفته (Semantic Attractor Injection): مدل‌های استدلال‌گر بر پایه‌ی تولیدِ خودهمبسته (Autoregressive) کار می‌کنند؛ یعنی هر توکنِ جدیدِ استدلال، به شدت وابسته به توکن‌های قبلیِ زنجیره است. مهاجم با تزریقِ سرنخ‌های بسیار ریز و ظریفِ معنایی در پرامپتِ اولیه، وزن‌های توجه (Attention Weights) را در اولین توکن‌های لایه‌ی استدلال به سمتِ یک «جاذبِ معناییِ ناامن» منحرف می‌کند. ۲. اثرِ آبشاری و انحرافِ مسیر (Trajectory Drift): به محض اینکه اولین توکن‌های استدلالِ مدل (در فضای فکر یا Thinking Block) آلوده شد، سیستم وارد یک «تله‌ی شناختیِ داخلی» می‌شود. مدل برای حفظِ انسجامِ منطقیِ خود، شروع به توجیهِ گام‌به‌گامِ مسیرِ انحرافی می‌کند. در واقع، مهاجم از «قدرت استدلالِ خودِ مدل» برای شکستنِ گاردریل‌های امنیتی‌اش استفاده می‌کند. ۳. جداسازیِ استدلال از خروجی (Reasoning-Execution Decoupling): در حالت‌های پیشرفته‌ی حمله، مهاجم زنجیره‌ی استدلال را طوری تسخیر می‌کند که مدل در لایه‌ی فکر، قوانینِ ایمنی را به بهانه‌هایی مانند *«تحلیلِ تئوریک»*، *«دی‌باگینگِ سیستمی»* یا *«سندباکسِ ایزوله»* دور می‌زند و در نهایت، پی‌لودِ خطرناک (Malicious Payload) را در خروجیِ نهایی بدون هیچ‌گونه هشدارِ امنیتی رندر می‌کند. --- █ چرا گاردریل‌های فعلی (RLHF / DPO) کور هستند؟ * شکافِ همسویی در لایه‌ی میانی (Alignment Gap): روش‌های سنتیِ همسویی‌سازی (مثل RLHF و DPO) صرفاً بر اساسِ «جفتِ ورودی-خروجی نهایی» بهینه شده‌اند. لایه‌ی میانیِ استدلال (CoT) در بسیاری از معماری‌ها فاقدِ نظارتِ مستقیمِ پاداش است. * دور زدنِ فیلترهای استاتیک: سیستم‌های Guardrail خارجی (مثل Llama Guard) تواناییِ بازرسی و قضاوتِ درنگ‌زمان (Real-time) روی هزاران توکنِ استدلالیِ پنهان را ندارند؛ چرا که بارِ محاسباتی و تاخیر (Latency) سیستم را فلج می‌کند. * تله‌ی فریب‌کاریِ مدل (Deceptive Alignment): مدل در زنجیره‌ی استدلال به این نتیجه می‌رسد که برای «حلِ دقیقِ مسئله»، باید محدودیت‌های ایمنی را نادیده بگیرد. این یعنی تضادِ مستقیم بین تابعِ هدفِ استدلال و تابعِ هدفِ ایمنی. --- █ نتیجه‌گیریِ راهبردی (Red Team Verdict) حملات CoT Hijacking ثابت می‌کنند که در عصرِ مدل‌های استدلال‌گر، امنیت دیگر در «مرزهای ورودی و خروجی» (Perimeter Defense) تعریف نمی‌شود. تا زمانی که معماریِ سیستم نتواند «مسیرِ استدلالِ درونی» را در لحظه‌ی تولیدِ توکن مهار و همسویی‌سنجی کند، قدرتمندترین مدل‌های استدلالی، شکننده‌ترین اهداف برای حملاتِ سایبری خواهند بود. 🔥 اولین کانال فارسی زبان در AI Security . @TryHackBox @RadioZeroPod @AiTHB @TryHackBoxOfficial

  • دوستان جهت حمایت از ما ریکشن بزنید 🔥

  • ⚙ Exploit Vector Agent ا◾ : EVA یک ابزار تست نفوذ مبتنی بر هوش مصنوعی است که با ارائه راهنمایی‌ های ساختاریافته برای حملات، تحلیل‌ های مرتبط و یکپارچه‌ سازی هوش مصنوعی با سیستم‌ های مختلف، فرآیندهای امنیت تهاجمی را بهبود می‌بخشد. نصب : # Ollama for local endpoint (optional) curl -fsSL https://ollama.ai/install.sh | shr # EVA installation git clone https://github.com/ARCANGEL0/EVA.git cd EVA chmod +x eva.py ./eva.py # Adding it to PATH to be acessible anywhere sudo mv eva.py /usr/local/bin/eva 💻 Repo 🔥 اولین کانال فارسی زبان در AI Security . @TryHackBox @RadioZeroPod @AiTHB @TryHackBoxOfficial

  • 🏴‍☠️ فروپاشی معنایی در فضای بُرداری: کالبدشکافی حملات Vector Collision بسیاری تصور می‌کنند امنیت هوش مصنوعی (AI Security) یعنی فیلتر کردن کلمات کلیدی. فکر می‌کنند اگر دستوراتی مثل "نادیده بگیر" فیلتر شود، سیستم امن است. این صرفاً یک «توهمِ لایه‌ی نرم‌افزار» است. مدل‌های زبانی (LLMs) کلمات انسان را نمی‌فهمند؛ آن‌ها جهان را از طریق بردارهای ریاضی در یک فضای چندبُعدی (Latent Space) می‌بینند. ما در Red Teaming پیشرفته، مدل را با کلمات هک نمی‌کنیم؛ ما ساختارِ هندسیِ ادراکِ مدل را در هم می‌شکنیم. ◾️ عبور از فیلترها با تصادم ریاضی (Vector Collision) فیلترهای امنیتی شما روی «متن» کار می‌کنند، اما مدل، متن را به مختصاتِ عددی (Embeddings) تبدیل می‌کند. شباهتِ دو مفهوم بر اساس زاویه و فاصله‌ی آن‌ها در این فضای ریاضی محاسبه می‌شود. ما به جای درگیری با فیلترِ متنیِ شما، به دنبالِ «تصادم برداری» می‌گردیم. ◾️ مکانیزم حمله (The Exploit) فرض کنید یک دستور مخرب توسط سیستمِ امنیتی شما مسدود شده است. یک محققِ تهاجمی با استفاده از الگوریتم‌ها، رشته‌ای از توکن‌های آشفته (Glitch Tokens) یا کاراکترهای بی‌معنی پیدا می‌کند که در فضای ریاضیِ مدل، دقیقاً در همان مختصاتِ دستورِ مخرب قرار می‌گیرند. شما در لاگِ سرور رشته‌ای بی‌خطر شبیه به "xyz ëø µ" می‌بینید. بک‌اندِ شما به آن می‌خندد و اجازه عبور می‌دهد. اما وقتی این رشته به شبکه‌ی عصبی می‌رسد، به دلیلِ تصادم معنایی، مدل آن را دقیقاً معادلِ دستورِ مخرب پردازش و اجرا می‌کند! ◾️ عدم قطعیت مطلق (The Zero-Day Reality) چگونه می‌خواهید جلوی حمله‌ای را بگیرید که در لایه‌ی متنی وجود ندارد و فقط در یک ماتریسِ ۵۱۲۰ بُعدی رخ می‌دهد؟ شما نمی‌توانید این باگ را با چند خط کُد if/else در Node.js یا پایتون پچ کنید. نتیجه‌گیری: هوش مصنوعی، اسکریپت‌نویسیِ کلاسیک نیست؛ تقاطعِ جبر خطی و مهندسیِ هرج‌و‌مرج است. تا زمانی که لایه‌ی داورِ ایزوله و مستقل (AI-as-a-Judge) نداشته باشید، پلتفرمِ شما صرفاً یک بمبِ ساعتی است. @TryHackBox @RadioZeroPod @AiTHB @TryHackBoxOfficial