Database
Статистика🕸 Database Academy حمایت مالی: https://www.coffeete.ir/mrbardia72 ادمین: @mrbardia72
- Последний пост
- 14 авг.
- Последнее чтение
- 15 авг.
- Постов за неделю
- 23
- Всего постов
- 307
- Тип
- открытый
- Язык
- персидский
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 34
- 1/48двое суток
- 38
- 1/72трое суток
- 42
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
در بلاگ جدیدم رفتم سراغ بررسی عملی پردازش ۱۰ گیگابایت داده روی لپتاپ شخصی با DuckDB و تجربههای کلیدی پردازش دادههای بزرگ بدون نیاز به کلود یا سرورهای گرانقیمت را نوشتم. در نهایت ۳۰ میلیون سطر داده متنی (حدود ۱۰.۵ گیگابایت) فقط در ۸۸ ثانیه وارد یک فایل ۲.۶۷ گیگابایتی DuckDB شد و زمان کوئریها از ۲.۱ ثانیه به ۰.۰۳ ثانیه رسید (۷۰ برابر سریعتر). البته باید حدود ۵۰ گیگ دیتای دیگه هم بهش اضافه بشه. ولی با این حال، سرعت موقع کوئری در حد میلی ثانیه ست. چند نکته بسیار مهم از این تجربه عملی: - قبل از شروع بارگذاری، بایتهای فایل را چک کنید. خطاهای کدگذاری مثل CP1252 و کاراکترهای غیر استاندارد میتوانند همان اول کار پردازش را خراب کنند. - الگوی all_varchar = true: ابتدا تمام ستونها را متنی بخوانید و سپس درون خود SQL نوع دادهها را تبدیل کنید. این کار مانع از تبدیل بیصدا و اشتباه دادهها به NULL میشود و صفرهای ابتدای کدها را حفظ میکند. - در جداول تحلیلی از Primary Key استفاده نکنید. تعریف کلید اصلی باعث ساخت ایندکسهای سنگین میشود که سرعت بارگذاری را ۱۷ برابر کندتر و حجم فایل را ۵.۶ برابر بزرگتر میکند. - مدیریت حافظه: با تنظیم preserve_insertion_order = false حافظه مصرفی بهشدت کاهش پیدا میکند و DuckDB حتی با محدودیت شدید حافظه (۱ گیگابایت رم) دادهها را بدون افت سرعت روی دیسک مدیریت میکند. متن کامل مقاله: http://mlnotes.substack.com <Mehdi Allahyari/>
1️⃣3️⃣ Telegram turns 13 today. For over half that time — the past 7,5 years — it's been one of the 10 most downloaded mobile apps in the world. A whole generation has grown up with it 💪 🎂 Happy birthday, Telegram!
🔵 عنوان مقاله TimeSeries Tiered Storage Journey: Kafka/Flink Streams to Native Cassandra Cold Reads (6 minute read) 🟢 خلاصه مقاله: در دنیای مدیریت دادههای زمانی بزرگ، طراحی سیستمهایی کارآمد و مقیاسپذیر اهمیت زیادی دارد. شرکت نتفلیکس با توسعه «سطحبندی ذخیرهسازی زمانی» (TimeSeries Tiered Storage) توانسته است حجم عظیمی از دادههای زمانی چندپتابایتی را با کارایی بالا مدیریت کند. در این سیستم، دادههای قدیمیتر و غیرقابل تغییر که دیگر نیازی به دسترسی سریع ندارند، از حافظه گرم در کاساندرا به ذخیرهسازی ارزانقیمتتر مانند S3 منتقل میشوند. این استراتژی به کاهش هزینهها و استفاده بهینه از منابع زیرساختی کمک میکند، در حالی که سرعت بازیابی دادههای قدیمیتر همچنان مناسب است. در نسخه اولیه این سیستم، از فناوریهایی مانند کافکا و فلینگ بهره گرفته شد. دادهها در قالب پارکت بهوسیله این ابزارها در حالتی پیوسته و مداوم به سمت S3 هدایت میشدند و روزانه عملیات فشردهسازی مجدد بر روی دادهها انجام میگرفت. این رویکرد امکان ارائه خوانشهای سرد با کمترین تأخیر حدود ۵۰۰ میلیثانیه در سطح p۹۹ را فراهم میکرد، ولی در عین حال، هزینه عملیاتی آن بسیار بالا بود و نیازمند زیرساختهای قدرتمند و نگهداری مداوم بود. در اصلاحات بعدی، نتفلیکس تصمیم گرفت تا از قابلیتهای بومی کاساندرا برای خوانش در سطح سرد بهرهمند شود. این سامانه به طور مستقیم از نسخههای پشتیبان S3، که حاوی دادههای فشرده سرد هستند، خوانش میکند. این رویکرد نه تنها حجم دادههایی که میتوان مدیریت کرد را افزایش داد، بلکه زمان پاسخدهی شدیداً بهبود یافته است؛ بهطوری که latency سطح p۹۰ حدود ۳۰ درصد کاهش یافته است. این تغییرات، باعث شد که سیستم بتواند به طور مؤثرتری نیازهای عملیاتی و تحلیلهای بزرگمقیاس را برآورده کند، بدون اینکه هزینهها و پیچیدگیها افزایش یابند. در نتیجه، این مسیر تحول در ذخیرهسازی دادههای زمانبندی شده نمونهای از نوآوری در حوزه دادههای بزرگ است که توازنی هوشمندانه میان هزینه، کارایی و مقیاسپذیری برقرار میکند و به سازمانها کمک میکند تا دادههای تاریخی خود را به بهترین شکل مدیریت کنند. #ذخیرهسازی_زمانی #کاساندرا #دیتای_بزرگ #مدیریت_داده 🟣لینک مقاله: https://netflixtechblog.medium.com/timeseries-tiered-storage-journey-kafka-flink-streams-to-native-cassandra-cold-reads-e59d597c9d60?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy
🔵 عنوان مقاله Dispatches from O'Reilly: The Best Risk Mitigation Strategy in Data? A Single Source of Truth (6 minute read) 🟢 خلاصه مقاله: در دنیای مدیریت دادهها، یکی از مهمترین چالشها، جلوگیری از تناقض در اعداد و اطلاعات است که میتواند کارایی و اعتماد به دادهها را زیر سوال ببرد. از همین رو، تعریف معیارها و معیارهای کلیدی فقط یکبار در لایه معنایی، راهحل موثری است تا اطمینان حاصل شود که تمامی ابزارهای تحلیل مانند Tableau، Power BI و نوتبوکها، همگی بر اساس دادههای یکسان و دقیق عمل میکنند. این رویکرد نه تنها خطر برخورد با ارقام متناقض را کاهش میدهد، بلکه فرآیند کنترل مجوزها و پیگیری تغییرات را از یک نقطه واحد ممکن ساخته و امکان ردیابی و حسابرسی سادهتر را فراهم میکند. در حقیقت، لایه معنایی نقش استراتژیک در کاهش ریسکهای عملیاتی دارد و به عنوان یک لایه اختیاری شناخته نمیشود بلکه جزو اجزای ضروری سیستمهای تحلیل و مدیریت داده است. با استفاده از این ساختار، سازمانها میتوانند با اطمینان بیشتری تصمیمگیری کنند و از صحت و ثبات دادههایشان در تمامی سطوح بهرهمند شوند، چرا که تمامی تغییرات و مجوزهای مربوط به معیارها و دادهها، از یک مکان مرکزی قابل کنترل است و خطاهای احتمالی به حداقل میرسد. در نتیجه، استراتژی تکمنبع حقیقت در دادهها، بهترین رویکرد برای کاهش ریسکهای عملیاتی و افزایش شفافیت در مدیریت دادهها است، روشی که تضمین میکند تمامی اتصالات به دادههای سازمان، بر پایه استانداردهای یکسان و قابل اعتماد صورت گیرد. #مدیریت_داده #کیفیت_اطلاعات #امنیت_داده #بهرهوری_سیستم 🟣لینک مقاله: https://stackoverflow.blog/2026/07/31/dispatches-from-o-reilly-the-best-risk-mitigation-strategy-in-data-a-single-source-of-truth/?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy
🔵 عنوان مقاله pyhctsa: Python Toolkit for Highly Comparative Time-Series Analysis (GitHub Repo) 🟢 خلاصه مقاله: ابزار pyhctsa یک مجموعه قدرتمند و کارآمد در زبان پایتون است که برای تحلیلهای جامع و پیوسته بر روی دادههای سری زمانی طراحی شده است. این ابزار به کاربران امکان میدهد صدها ویژگی آماری و ساختاری مختلف را از یک یا چند سری زمانی استخراج کنند. یکی از مزایای مهم این مجموعه، قابلیت پیکربندی و سفارشیسازی مجموعه ویژگیها است که به محققان و تحلیلگران داده امکان میدهد بر اساس نیازهای خاص، ویژگیهای دلخواه خود را اضافه یا تغییر دهند. علاوه بر این، pyhctsa قادر است ورودیهای با طولهای متفاوت را به خوبی مدیریت کند و در نتیجه، انعطافپذیری بالایی برای تحلیل دادههای متنوع دارد. این مجموعه ابزار همچنین از فراخوانی مستقیم عملیات و انجام تحلیلها به صورت همزمان بر روی هستههای پردازشی محلی CPU پشتیبانی میکند. این قابلیت باعث میشود روند تحلیل دادهها بسیار سریعتر و بهینهتر انجام شود، به ویژه در مواردی که حجم دادهها زیاد است یا نیاز است تحلیلهای پیچیده و زمانبر انجام شود. به طور کلی، pyhctsa ابزاری قدرتمند و انعطافپذیر است که فرآیند تحلیل سریهای زمانی را آسانتر، سریعتر و قابل تنظیمتر میکند، و برای دانشمندان، محققان و تحلیلگران داده بسیار مفید است. #تحلیل_سری_زمانی #ابزار_پایتون #دادهکاوی #پیشرفته 🟣لینک مقاله: https://github.com/DynamicsAndNeuralSystems/pyhctsa?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy
🔵 عنوان مقاله SQL Improvements in Postgres 11–18: A Personal Selection 🟢 خلاصه مقاله: در نسخههای ۱۱ تا ۱۸ پستگرس، شاهد پیشرفتهای قابل توجهی در بخشهای مختلف SQL بودهایم. این نسخهها هشت انتشار مختلف را در بر میگیرند که هر کدام ویژگیهای جدید و بهبودهای ویژهای را به همراه داشتهاند. در این مقاله، یک متخصص دیرینه در توسعه پایگاههای داده، مهمترین ویژگیهای این دورهها را بر اساس موضوعات مختلف انتخاب و دستهبندی کرده است. یکی از بخشهایی که قطعاً توجهها را جلب میکند، مدلسازی عضویت در گروهها در طول زمان است. ابزارهای جدید مانند tstzmultirange و تابع range_agg() امکانات بینظیری را در این حوزه فراهم کردهاند. این ابزارها به توسعهدهندگان اجازه میدهند تحلیلهای پیچیدهتری بر روی تغییرات عضویت در گروهها انجام دهند و روندهای تاریخی را به شکل موثرتری نشان دهند. اگر به دنبال درک بهتر نحوه مدیریت و تحلیل عضویتهای زمانی در پایگاه دادههای خود هستید، مطالعه این قسمت ارزش زیادی دارد. در کل، نسخههای ۱۱ تا ۱۸ پستگرس مجموعهای غنی از قابلیتهای جدید ارائه میدهند که کار با SQL و مدلسازی دادهها را سادهتر، سریعتر و قدرتمندتر میکنند. مطمئناً این تحولات میتوانند تاثیر قابل توجهی در پروژههای دادهمحور شما داشته باشند. #پستگرس #SQL #پایگاه_داده #توسعه 🟣لینک مقاله: https://tapoueh.org/blog/2026/07/sql-improvements-in-postgresql-1118-a-personal-selection/ ➖➖➖➖➖➖➖➖ 👑 @Database_Academy
🔵 عنوان مقاله How and Why Netflix Built a Real-Time Distributed Graph: Part 3 — Querying the graph with gRPC execution API (20 minute read) 🟢 خلاصه مقاله: در قسمت سوم مقاله “چگونه و چرا نتفلیکس یک گراف توزیعشده در زمان واقعی ساخت”، به بررسی نحوهٔ پرسوجو از این گراف با استفاده از API اجرای gRPC میپردازیم. در این بخش، تمرکز بر روی سازوکارهای تکنولوژیکی و کارایی سیستم است که نتفلیکس در پردازش میلیاردها نود و میلیاردها یال به کار میگیرد. شبکه پرسوجوی لرزهنگار نتفلیکس (RDG) قادر است با بهرهگیری از پاراللسازی مرحلهای، در هر نمونه سیستم، بین ۱۶ تا ۲۴ رشته اجرای ناهمزمان (async) را فعال کند. این رویکرد باعث میشود عملیات پرسوجو بتواند بسیار سریع انجام شود و در عین حال، سیستم بتواند حجم گستردهای از دادهها را در کوتاهترین زمان ممکن مدیریت کند. این ساختار برای پاسخدهی به درخواستها، سطوح حافظهپنهان (کَش) را با توجه به نوسانات دادهها تنظیم میکند، به طوری که نرخ برخورد (hit rate) در موارد دادههای پایدار به ۷۰ تا ۸۰ درصد میرسد. این امر در نتیجه باعث کاهش قابل توجه زمان پاسخها میشود؛ به عنوان نمونه، حتی پرسوجوهای چندهاپی (سهگام) در کمتر از ۱۵۰ میلیثانیه در حالت معمول اجرایی میشوند، آن هم در مسیرهای دروازهزن (P99) که سختترین حالتها را نشان میدهند. در نتیجه، این معماری مقیاسپذیر و بهینه، نتفلیکس را قادر ساخته است که پرسوجوهای پیچیده در زمان واقعی را با کارایی بالا و کمترین تأخیر ممکن انجام دهد، که این دقیقا نیاز این پلتفرم بزرگ در ارائه خدمات بیوقفه و سریع است. #گراف_پرسوجو #زمان_واقعی #پایگاه_داده #نتفلیکس 🟣لینک مقاله: https://netflixtechblog.com/how-and-why-netflix-built-a-real-time-distributed-graph-part-3-querying-the-graph-with-grpc-0f3468349607?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy
🔵 عنوان مقاله Data lessons from inside Meta (Shridhar Iyer) (12 minute read) 🟢 خلاصه مقاله: امپراتوری دادههای متا به سمت اتحاد و سازماندهی بهتر حرکت کرده است. پلتفرم دادههای این شرکت اکنون به یک ساختار منسجم و قوی تبدیل شده است که شامل لایههای متعددی مانند کاتالوگ متمرکز، طبقهبندی، روابط اولیه و سیاستهای مدیریت اطلاعات است. این تحول بزرگ باعث شده است که مدیریت دادهها راحتتر، کارآمدتر و قابل کنترلتر باشد، و تیمهای مختلف بتوانند به راحتی به دادههای مورد نیاز دسترسی پیدا کنند و فرآیندهای تحلیلی را سریعتر انجام دهند. در مسیر توسعه این سیستم، متا با درسهای مهمی درباره مقیاس و هزینهها روبهرو شده است. یکی از این درسها این بود که حذف یا اصلاح سریع ستونهای خطایابی کوتاه، توانسته است صرفهجوییهای زیادی در هزینهها ایجاد کند؛ به طوری که تنها با کاهش چندین ستون، میلیونها دلار صرفهجویی شد. همچنین، برای جداول اصلی که بخش قابل توجهی از پایگاه دادهها را تشکیل میدهند، به جای حذف کردن نسخهها، روی نسخهبندی آنها تمرکز شد تا تاریخچه تغییرات حفظ شده و عملیات بهبودیافتهتر انجام شود. این رویکرد، علاوه بر حفظ دادههای حیاتی، کارایی سیستم را نیز افزایش داد. در نهایت، متا به سمت هوش مصنوعی و قابلیتهای پیشرفتهتر پیش میرود؛ اما این مسیر با ساختارهای کاری قابل استفاده مجدد و اصول اولیه فرآیندهای کاری شروع میشود. پایهگذاری روندهای قابل تکرار و استانداردسازی فرآیندها، نقطه شروع مهمی است تا بتوان سیستمهای هوشمند و یادگیری ماشین را به طور مؤثر توسعه داد. در مجموع، درسهای متا نشان میدهد که توسعه و مدیریت دادهها در مقیاس بزرگ نیازمند ساختار منسجم، تصمیمات هوشمندانه و تمرکز بر استانداردسازی است. #داده #مدیریت_داده #هوشمندسازی #پایگاه_داده 🟣لینک مقاله: https://roundup.getdbt.com/p/data-lessons-from-inside-meta-shridhar?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy
🔵 عنوان مقاله The Art of PostgreSQL 🟢 خلاصه مقاله: در دنیای پایگاههای داده، PostgreSQL به عنوان یکی از قدرتمندترین و پرکاربردترین سیستمها شناخته میشود. یکی از ویژگیهای مهم آن، توانایی تنظیم و بهینهسازی کوئریها برای افزایش بهرهوری است. اخیراً، محققان و توسعهدهندگان ابزارهای متنوعی برای تسهیل این فرآیند توسعه دادهاند. یکی از پیشرفتهای جالب، ارائه ابزارهای خودکار است که به صورت برنامههای مستقل یا کدهای کمکی ساخته شدهاند تا بتوانند به صورت خودکار کوئریهای PostgreSQL را بهینه کنند. در این میان، یک ابزار نوشته شده با زبان Go وجود دارد که وظیفه بهکارگیری این بهینهسازیها را به صورت خودکار بر عهده دارد. این ابزار کارآمد، با تحلیل کوئریهای شما، به صورت هوشمندانه پیشنهاداتی ارائه میدهد و در نهایت، تغییرات لازم را بر روی کوئریها اعمال میکند. این روش، نه تنها خطاهای انسانی در بهکارگیری بهینهسازیها را کاهش میدهد، بلکه فرآیند توسعه و بهبود عملکرد پایگاه دادهها را بسیار سریعتر و سادهتر میسازد. علاوه بر این، یکی از قابلیتهای مهم این ابزار، وجود نسخه تحت وب آن است. با استفاده از این نسخه، میتوانید بدون نیاز به نصب نرمافزارهای پیچیده، به راحتی روی مرورگر وب کار کنید و کوئریهای خود را قبل از اجرا، به خوبی تست و بهینهسازی کنید. این قابلیت، به ویژه زمانی که در حال آمادهسازی ارائه، مقاله یا پروژههای آموزشی هستید، بسیار مفید است. بنابراین، اگر به دنبال راهی سریع و مطمئن برای بهبود کارایی کوئریهای PostgreSQL خود هستید، حتماً این ابزار را امتحان کنید. در نهایت، بهرهگیری از ابزارهای خودکار و آنلاین، گامی مهم در مسیر توسعه و مدیریت بهتر پایگاههای داده است که میتواند چشماندازهای جدیدی را برای توسعهدهندگان فراهم آورد و فرآیندهای کاری را بسیار هوشمندانهتر و کارآمدتر کند. #پایگاه_داده #PostgreSQL #برنامه_نویسی #توسعه 🟣لینک مقاله: https://theartofpostgresql.com/ ➖➖➖➖➖➖➖➖ 👑 @Database_Academy
🔵 عنوان مقاله Microsoft almost gave away the keys to everyone's Azure Cosmos DBs (2 minute read) 🟢 خلاصه مقاله: اخیراً، یک هشدار جدی برای کاربران سرویس Azure Cosmos DB مایکروسافت به وجود آمده است. گزارشی منتشر شد که نشان میدهد در برخی موارد، پلتفرمهای مدیریتشده NoSQL میتوانند کلیدهای اصلی را در اختیار کاربران غیرمجاز قرار دهند. این موضوع یک یادآوری مهم است که حتی سیستمهای امن و مدیریتشده نیز در معرض خطر افشای کلیدهای حساس قرار دارند. در واقع، وجود چنین مشکلاتی نشان میدهد که سازمانها باید همواره سیاستهای امنیتی مربوط به نگهداری و مدیریت کلیدهای رمزنگاری را بازبینی و بهروزرسانی کنند. اطمینان از دورهای بودن فرآیندهای چرخش کلیدها و بررسی منظم مجوزها و سیاستهای دسترسی از نکات حیاتی است که باید جدی گرفته شود. صرف نظر از سطح اطمینان به سرویسهای ابری، رعایت پروتکلهای امنیتی و نظارت مداوم بر وضعیت امنیتی، کلیدواژههای کلیدی در حفظ حریم خصوصی و سلامت سیستمها هستند. در مجموع، این حادثه نشان میدهد که سازمانها نباید فریب امنیت ظاهری سرویسهای ابری را بخورند و باید همواره به رویکردهای امنیتی فعال و بهروزرسانی مداوم سیاستها متعهد باشند تا در برابر تهدیدهای بالقوه مصون بمانند. #امنیت_ابری #کلیدهای_رمزنگاری #امنیت_سایبری #پایش_امنیت 🟣لینک مقاله: https://www.infoworld.com/article/4203930/microsoft-almost-gave-away-the-keys-to-everyones-azure-cosmos-dbs-2.html?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy
🔵 عنوان مقاله Parting the Clouds: The Rise of Disaggregated Systems (47 minute video) 🟢 خلاصه مقاله: در دنیای فناوری اطلاعات امروز، یکی از روندهای مهم در بهبود سیستمهای ابری، تفکیک منابع محاسباتی بدون حالت و ذخیرهسازی اشتراکی است. این رویکرد که در واقع به معنای جدا کردن سرورهای محاسباتی از فضای ذخیرهسازی، به شرکتها امکان میدهد تا با انعطافپذیری بیشتر، انواع خطاها را بهتر مدیریت کرده و اقتصاد هزینهای بهتری را بر پایه استفادهبهازای پرداخت، فراهم کنند. هدف اصلی این است که سیستمها بتوانند در صورت نیاز به سرعت مقیاسپذیر شوند و انعطافپذیری در مدیریت منابع به صورت قابل توجهی افزایش یابد. در عین حال، این رویکرد چالشهایی نیز دارد؛ مهمترین آنها تأخیر در انتقال دادههای بین سرورها و ذخیرهسازی است، و همچنین نیاز به پهنای باند بالا برای انتقال دادهها. شرکتهایی مانند اورورا (Aurora)، آلیاودبیبی (AlloyDB)، DSQL، پلاردیبی (PolarDB) و تاکورسدیبی (TaurusDB) برای غلبه بر این چالشها از فناوریهایی مانند بافرینگ، پیشبارگذاری، فشار دادن عملیات محاسباتی بر روی سرور و فناوریهای پیشرفتهای چون RDMA و CXL بهره میبرند. این سیستمها همچنین با طراحی دقیق لاگها و ساختارهای ذخیرهسازی، سعی در به حداقل رساندن تأخیر و حداکثر بهرهوری از منابع دارند. این راهکارها نشاندهندهی حرکت مهم در توسعه سیستمهای ابری مدرن است که آیندهای پویا و قدرتمند را رقم میزند. #سیستم_های_ابری #پایگاههایداده #فناوریاطلاعات #مدیریتذخیرهسازي 🟣لینک مقاله: https://www.infoq.com/presentations/disaggregation-industrial-systems/?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy
🔵 عنوان مقاله pgGraph (GitHub Repo) 🟢 خلاصه مقاله: در دنیای پایگاههای داده، گسترش امکانات و بهبود کارایی همیشه نیازمند نوآوری و فناوریهای نوین است. یکی از این نوآوریها، افزونهای به نام PgGraph است که برای سیستم مدیریت پایگاه داده PostgreSQL طراحی شده است. این افزونه قدرتمند به کاربران امکان میدهد تا جستجوهای گرافی سریع، عملیات پیمایش و پیدا کردن کوتاهترین مسیر را به راحتی و بدون نیاز به انتقال دادهها به پایگاه دادههای گراف مستقل یا یادگیری زبانهای پرسوجوی جدید انجام دهند. در واقع، PgGraph نقش یک ابزار موثر و کارا را ایفا میکند که میتواند در کنار PostgreSQL فعال باشد و عملیاتهای پیچیدهی مرتبط با گرافها را به سادگی مدیریت کند. این افزونه در فرآیند ساخت و توسعه، یک شاخص گرافی قابل بازسازی و بهینه برای حافظه را فراهم میآورد، و این در حالی است که PostgreSQL همچنان به عنوان منبع رسمی و پایهی اصلی دادهها باقی میماند. با استفاده از PgGraph، کاربران دیگر نیاز ندارند سیستمهای جداگانه و تخصصی برای مدیریت دادههای گرافی راهاندازی کنند؛ بلکه میتوانند بهرهوری و توانمندیهای گرافی را در همان سیستم موجود و بدون پیچیدگیهای اضافی فعال سازند. این فناوری با تمرکز بر سرعت و سهولت توسعه، راهکاری قوی و قابل اطمینان برای توسعه دهندگان و تحلیلگران داده است. در نتیجه، PgGraph با ادغام مستقیم در پایگاه داده PostgreSQL، امکانات بینظیری برای تحلیلهای پیچیدهی ارتباطی، پیمایش ساختارهای پویای داده و یافتن مسیرهای کوتاه فراهم میکند. این ابزار نه تنها کارایی را افزایش میدهد، بلکه فرایند مدیریت و تحلیل دادههای مرتبط را سادهتر و سریعتر میسازد، و باعث میشود که کاربران بتوانند تصمیمگیریهای بهتری بر اساس دادههای ساختیافته و رابطهای انجام دهند. #پایگاه_داده #گراف #تحلیل_داده #PostgreSQL 🟣لینک مقاله: https://github.com/Evokoa/pgGraph?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy
🔵 عنوان مقاله Database Animations: Why Big Columns May Not Affect Logical Reads (3 minute read) 🟢 خلاصه مقاله: در پایگاههای داده، نحوه طراحی ستونها و ساختار جداول نقش مهمی در عملکرد سیستم دارد. یکی از مسائلی که اغلب مورد توجه قرار میگیرد، تاثیر عمودهای بزرگ یا همان ستونهای حجیم بر عملیات جستجو و خواندن دادهها است. در واقع، در برخی موارد، بزرگ بودن ستونها ممکن است بر فرآیندهای خاصی مانند اسکنهای کلی و خواندن چندرونبهای تأثیرگذار باشد، اما در عملیات نقطهای یا همان جستجوهای تککورد، محدودیت چندانی ایجاد نمیکند و معمولاً دادههای لازم در یک صفحه 8 کیلوبایتی جای میگیرند. این تفاوت در کارایی، اهمیت شناخت نحوه اتصال و سازماندهی دادهها در سیستمهای پایگاه داده را نشان میدهد و به توسعهدهندگان کمک میکند تا ساختار مناسب را برای بهبود عملکرد انتخاب کنند. در نتیجه، باید توجه داشت که طراحی جداول باید با در نظر گرفتن نوع عملیات غالب در سیستم باشد، زیرا ساختار مناسب میتواند تاثیر قابل توجهی در کم کردن زمان اجرای کوئریها و بهبود عملکرد کلی سیستم داشته باشد. بنابراین، اگر هدف شما عملیاتهایی است که بیشتر بر خواندن چندرونبهای تمرکز دارد، در نظر گرفتن اندازه ستونها و نحوه قرارگیری آنها در صفحات داده اهمیت زیادی پیدا میکند تا بدون وارد آمدن فشار اضافی بر سیستم، کارآیی مطلوب حفظ شود. تفاوتهای این نوع طراحی در کنار ویژگیهای سیستم SQL Server نشان میدهد که تمرکز بر بهینهسازی عملیاتهای خاص، میتواند در هزینههای منابع و سرعت پاسخگویی تاثیرگذار باشد و در نتیجه، توسعهدهندگان باید این نکات را در فرآیند طراحی پایگاه داده در نظر بگیرند. #پایگاه_داده #عملکرد #SQLServer #بهینهسازی 🟣لینک مقاله: https://www.brentozar.com/archive/2026/08/database-animations-why-big-columns-may-not-affect-logical-reads/?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy
🔵 عنوان مقاله Your Next "Access Database Problem" Is an AI Agent (16 minute read) 🟢 خلاصه مقاله: در دنیای فناوری امروز، هوش مصنوعی به سرعت در حال تحول است و ابزارهای نرمافزاری مبتنی بر هوش مصنوعی به قدری سریع و ارزان ساخته میشوند که شرکتها ممکن است هزاران ابزار بدون مستندسازی و نظارت مناسب ایجاد کنند. این ابزارها، که غالباً مالکیت، مجوزها، وابستگیها و نحوه رفتار آنها مشخص نیست، میتوانند خطرات زیادی برای سازمان به همراه داشته باشند. در نتیجه، مشکل بزرگ بعدی که ممکن است با آن روبرو شویم، پیچیدگیهای مربوط به مدیریت این فهرست بلندبالای ابزارهای خودساخته است. پیشنهاد اصلی این است که نباید مانع از تولید این ابزارها شویم، بلکه باید سیستمهایی را پیادهسازی کنیم که نقش ناظر و تنظیمکننده را ایفا کنند. در واقع، باید در بستر پلتفرم، سازوکارهای حکمرانی و کنترلهای خودکار قرار دهیم که به صورت هوشمند، هویت، مجوزها، ثبت رویدادها، مالکیت، تاریخ انقضا و کنترلهای امنیتی قویتر را در پروسه ساخت و استفاده از این ابزارها تضمین کنند. با این روش، با افزایش میزان ریسک، کنترلها خودکار و مقیاسپذیر عمل میکنند و خطاها و سوءاستفادهها کاهش مییابد. در نتیجه، تمرکز باید بر طراحی و پیادهسازی قوانین و ساختارهای مدیریتی مبتنی بر هوش مصنوعی باشد که بتوانند به صورت اتوماتیک روند مدیریت ابزارهای توسعه یافته را هدایت و نظارت کنند. این رویکرد، هم فرآیند توسعه را تسهیل مینماید و هم امنیت و کنترلها را ارتقاء میدهد، تا سازمانها در جریان پیشرفتهای سریع فناوری، همچنان در مسیر امن و منظم باقی بمانند. #هوش_مصنوعی #مدیریت_ابزار #حکمرانی_دیجیتال #امنیت 🟣لینک مقاله: https://sjg.io/writing/your-next-access-database-problem-is-an-ai-agent/?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy
🔵 عنوان مقاله Tytan: Interactive Neurosymbolic Construction of Analytic Semantic Schemas from Relational Data (37 minute read) 🟢 خلاصه مقاله: تیتان با هدف تسهیل فرآیند ساخت ساختارهای معنایی تحلیلی، به طور خودکار اسکیمای معنایی را از دادههای رابطهای یا جدولی ایجاد میکند. این سامانه از ترکیب استنتاج معنایی مبتنی بر مدلهای زبانی بزرگ (LLM) و بررسیهای قطعی مانند کلیدها، پیوندها، انواع داده و مقادیر استفاد میکند. در این روند، تنها زمانی از کاربر سوال میپرسد که ابهامی باقی میماند، که این باعث کاهش خطا و افزایش دقت میشود. در طول آزمایشهای انجامشده بر روی هشت پایگاه داده مختلف، تیتان عملکرد قابل توجهی از خود نشان داد. این سیستم توانست تمامی ارجاعات را پوشش دهد، تمامی ۳۷۵۸ آزمایش بازیابی را با موفقیت انجام دهد و میزان همسویی با نقشهای معنایی را بین ۹۲ تا ۱۰۰ درصد حفظ کند. این موفقیتها نشان دهنده قابلیت اطمینان و کارایی بالای این فناوری در تحلیل و تفسیر دادههای ساختاری است، که میتواند کاربردهای متنوعی در حوزههای هوش مصنوعی، تحلیل داده و پردازش زبان طبیعی داشته باشد. در نهایت، تیتان یکی از پیشرفتهترین روشهای خودکار برای ساخت ساختارهای معنایی است که، با بهرهگیری از هوش مصنوعی و بررسیهای دقیق، به کاربر امکان میدهد دادهها را به شکلی مؤثر و معنادار تفسیر و تحلیل کند، و به این ترتیب مرزهای فهم انسانی و ماشینی در تحلیل دادهها را نزدیکتر مینماید. #هوش_مصنوعی #تحلیل_داده #معناشناسی #مدلهای_زبان 🟣لینک مقاله: https://arxiv.org/abs/2608.06331?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy
🔵 عنوان مقاله Xberg (GitHub Repo) 🟢 خلاصه مقاله: اینجا یک موتور منبع باز قدرتمند به نام Xberg قرار دارد که توانایی استخراج متن، جداول، متادادهها و دادههای ساختاریافته از بیش از صد فرمت مختلف را داراست. این فرمتها شامل فایلهای PDF، تصاویر، فایلهای صوتی و تصویری، لینکهای وب، آرشیوهای فشرده و کدهای برنامهنویسی میشوند. هسته اصلی این موتور بر پایه زبان برنامهنویسی Rust نوشته شده است که نه تنها از 15 زبان مختلف پشتیبانی میکند، بلکه امکانات متنوعی مانند تشخیص متن از طریق OCR، تبدیل صوت به متن، تولید بردارهای معنایی، استخراج ساختاریافته و قابلیتهای استقرار را در برمیگیرد. این ابزار قدرتمند با انعطافپذیری بالا امکان استفاده از طریق کتابخانههای کد، خط فرمان، APIهای REST، بستههای مدیریت کانتینر مانند Docker و Helm را فراهم میکند. یعنی توسعهدهندگان و شرکتها میتوانند آن را در پروژههای مختلف با سادهترین راهکارها به کار گیرند و فرآیندهای استخراج اطلاعات را به شکل قابل اعتماد و سریع انجام دهند. بنابراین، Xberg یک راهحل جامع برای نیازهای استخراج داده در حوزههای مختلف فناوری اطلاعات و پردازش متن است. #استخراج_داده #نرمافزار_منبع_باز #هوش_مصنوعی #پیشرفت_تکنولوژی 🟣لینک مقاله: https://github.com/xberg-io/xberg?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy
🔵 عنوان مقاله Validating Data With Pointblank in Python (30 minute read) 🟢 خلاصه مقاله: در دنیای تحلیل دادهها و مدیریت پایگاههای داده، صحت و معتبر بودن اطلاعات اهمیت بسیار زیادی دارد. یکی از ابزارهای قدرتمند و در عین حال ساده برای اطمینان از کیفیت دادهها، کتابخانه Pointblank در زبان پایتون است. این ابزار به کمک قوانین تعریفشده، آستانههای مختلف و مدیریت خودکار خطاها، فرآیند اعتبارسنجی دادهها را بسیار ساده و موثر میکند. میتوان گفت که Pointblank بیشتر بر اصول کنترل کیفیت، بررسیهای سطح سطر و ارائه گزارشهایی مناسب برای ذینفعان تمرکز دارد، در مقایسه با ابزارهای دیگر مانند Pandera و Great Expectations. با استفاده از Pointblank، میتوان به راحتی دادههای موجود در منابع مختلفی مانند pandas، Polars، DuckDB و PostgreSQL را اعتبارسنجی کرد. این ابزار با بهرهگیری از قواعد تعریفشده، به کاربران اجازه میدهد تا خطاهای احتمالی در دادهها را به سرعت شناسایی و رفع کنند. علاوه بر این، قابلیتهای مرتبط با محدود کردن خطاها در سطح ردیف، فرآیند مدیریت دادههای ناسازگار و نادرست را بسیار بهبود میبخشد و سیستمهای پایش کیفیت داده را کارآمدتر میسازد. گزارشهای جامع و قابل فهمی که Pointblank تولید میکند، به ذینفعان کمک میکند تا به درک بهتر از وضعیت دادهها برسند و تصمیمگیریهای مبتنی بر دادههای صحیح و سالم را تسهیل کند. در مجموع، اگر به دنبال ابزاری هستید که فرآیند اعتبارسنجی دادههایتان را سادهتر، دقیقتر و کاراتر کند، Pointblank گزینهای عالی است. این ابزار نه تنها در زمینه کنترل کیفیت دادهها قوی است، بلکه با ارائه گزارشهای شفاف و امکانات سطح پیشرفته، نقش مهمی در تضمین صحت دادههای شما ایفا میکند. استفاده از این ابزار در پروژههای دادهمحور، بهرهوری تیمهای تحلیلگر و مدیران داده را به طور قابل توجهی افزایش میدهد و اطمینان بیشتری از صحت و سلامت دادهها ایجاد میکند. #کیفیت_داده #پایگاه_داده #اعتبارسنجی_داده #پایتون 🟣لینک مقاله: https://realpython.com/python-pointblank/?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy
@persianpost_official
🔵 عنوان مقاله WeatherNext: AI model achieves breakthrough in forecasting cyclones (9 minute read) 🟢 خلاصه مقاله: در دنیای پیشبینی وضع هوا، مدل هوشمند WeatherNext توانسته است تحولی چشمگیر ایجاد کند. این سیستم پیشرفته قادر است مسیرهای چرخندهای هوایی، شدت آنها و سرعت بادهای مرتبط را با دقت بالا و بیش از یک روز زودتر از مدلهای مرسوم پیشبینی کند. در حقیقت، این فناوری جدید باعث میشود که روابط بحرانی و رویدادهای خطرناک در مدت زمان بیشتری قابل پیشبینی باشند، و این امر به نجات جان و مال مردم کمک میکند. مدل WeatherNext با بهرهگیری از فناوریهای نوین هوش مصنوعی و تجزیه و تحلیل دادههای وسیع، توانسته است در عرصه پیشبینی طوفانهای حارهای پیشرفت قابل توجهی داشته باشد. این سیستم نه تنها مسیر احتمالی چرخندهای هواشناسی را مشخص میکند، بلکه شدت آنها و قدرت بادهای ضمنی را نیز با دقت بالا تخمین میزند. نتیجه این است که مدیران بحران و مراقبتهای اضطراری فرصت بیشتری برای آمادگی و اقدام موثر را پیدا میکنند؛ چیزی که سابق بر این در دسترس نبود. در مجموع، این فناوری پیشرفته، چشماندازی نوین برای آینده پیشبینیهای جوی ارائه میدهد. با پیشرفتهای مداوم در حوزه هوش مصنوعی، انتظار میرود که دقت این مدلها بهبود بیابد و بر قابلیت پیشبینی رویدادهای طبیعی افزوده شود، و در نتیجه، جامعهها بتوانند بهتر و سریعتر واکنش نشان دهند و آسیبهای ناشی از بلایای طبیعی را کاهش دهند. #پیش_بینی_طوفان #هوش_مصنوعی #مدیریت_بحران #آینده_پیشبینی 🟣لینک مقاله: https://deepmind.google/blog/weathernext-ai-model-achieves-breakthrough-in-forecasting-cyclones/?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy
🔵 عنوان مقاله Kafka App? There's a Skill for That (9 minute read) 🟢 خلاصه مقاله: کافکا اپ؟ مهارتی برای آن وجود دارد گروه Etsy با توسعه مهارتهای Claude Code برای هفت فرآیند جریان داده در کافکا، نشان داد که میتوان فناوریهای نوین را در زمینه مدیریت دادههای بزرگ و جریانساز بهکار گرفت. این مهارتها به طور خاص برای فرآیندهای حیاتی مانند تولید ویژگیهای یادگیری ماشین، ساختن بردارهای تعبیه شده (embeddings) و پیادهسازی پایپلاینهای توزیعشده طراحی شدهاند. هدف از این اقدام، سادهسازی و بهبود کارایی عملیاتهای مربوط به دادههای بزرگ در زمینههای مختلف است. شرکت Etsy در این پروژه تلاش کرده است که با بهرهگیری از مهارتهای کلاود و ابزارهای هوشمند، فرآیندهای جریان داده خود را به صورت موثر و سریع مدیریت کند. این فناوریها امکان تولید ویژگیهای مورد نیاز برای آموزش مدلهای یادگیری ماشین، ساخت بردارهای تعبیه شده برای درک بهتر محتوای دادهها، و همچنین توزیع دادهها به صورت همزمان در بخشهای مختلف کسبوکار را فراهم میآورند. نتیجه نهایی، فرآیندی است که به شرکتها امکان میدهد دادههای خود را بهتر، سریعتر و هوشمندانهتر مدیریت کنند. در مجموع، این توسعه نشان میدهد که مهارتهای برنامهنویسی و فناوریهای نوین میتوانند در حوزههای مختلف صنعت، از جمله تولید محتوا، تجارت الکترونیک و هوش مصنوعی، تاثیرگذار باشند و فرآیندهای پیچیده را ساده کنند. به کارگیری چنین فناوریهایی، آیندهای نویدبخش در زمینه مدیریت هوشمند دادهها را نوید میدهد. #کافکا #هوش_مصنوعی #مدیریت_داده #فناوری 🟣لینک مقاله: https://www.etsy.com/codeascraft/kafka-app-thereas-a-skill-for-that?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy