tgindex

Database

описание

🕸 Database Academy حمایت مالی: https://www.coffeete.ir/mrbardia72 ادمین: @mrbardia72

848
подписчиков
Охват к подписчикам
4,2%
ERR
Реакции к просмотрам
0,19%
5 на 49 постов
Пересылки к просмотрам
0,34%
9
Постов в день
2,7
всего 307

Где отзываются чаще

доля реакций к просмотрам
  • 7 авг.без подписи4,62%
  • 7 авг.без подписи2,82%
  • 14 авг.در بلاگ جدیدم رفتم سراغ بررسی عملی پردازش ۱۰ گیگابایت داده روی لپ‌تاپ شخصی با DuckDB و تجربه‌های کلیدی پردازش داده‌های بزرگ بدون نیاز به کلود یا سرورهای گران‌قیمت را نوشتم. در نهایت ۳۰ میلیون سطر داده متنی (حدود ۱۰.۵ گیگابایت) فقط در ۸۸ ثانیه وارد یک فایل ۲.۶۷ گیگابایتی DuckDB شد و زمان کوئری‌ها از ۲.۱ ثانیه به ۰.۰۳ ثانیه رسید (۷۰ برابر سریع‌تر). البته باید حدود ۵۰ گیگ دیتای دیگه هم بهش اضافه بشه. ولی با این حال، سرعت موقع کوئری در حد میلی ثانیه ست. چند نکته بسیار مهم از این تجربه عملی: - قبل از شروع بارگذاری، بایت‌های فایل را چک کنید. خطاهای کدگذاری مثل CP1252 و کاراکترهای غیر استاندارد می‌توانند همان اول کار پردازش را خراب کنند. - الگوی all_varchar = true: ابتدا تمام ستون‌ها را متنی بخوانید و سپس درون خود SQL نوع داده‌ها را تبدیل کنید. این کار مانع از تبدیل بی‌صدا و اشتباه داده‌ها به NULL می‌شود و صفر‌های ابتدای کدها را حفظ می‌کند. - در جداول تحلیلی از Primary Key استفاده نکنید. تعریف کلید اصلی باعث ساخت ایندکس‌های سنگین می‌شود که سرعت بارگذاری را ۱۷ برابر کندتر و حجم فایل را ۵.۶ برابر بزرگ‌تر می‌کند. - مدیریت حافظه: با تنظیم preserve_insertion_order = false حافظه مصرفی به‌شدت کاهش پیدا می‌کند و DuckDB حتی با محدودیت شدید حافظه (۱ گیگابایت رم) داده‌ها را بدون افت سرعت روی دیسک مدیریت می‌کند. متن کامل مقاله: http://mlnotes.substack.com <Mehdi Allahyari/>0,00%
  • 14 авг.1️⃣3️⃣ Telegram turns 13 today. For over half that time — the past 7,5 years — it's been one of the 10 most downloaded mobile apps in the world. A whole generation has grown up with it 💪 🎂 Happy birthday, Telegram!0,00%
  • 14 авг.🔵 عنوان مقاله TimeSeries Tiered Storage Journey: Kafka/Flink Streams to Native Cassandra Cold Reads (6 minute read) 🟢 خلاصه مقاله: در دنیای مدیریت داده‌های زمانی بزرگ، طراحی سیستم‌هایی کارآمد و مقیاس‌پذیر اهمیت زیادی دارد. شرکت نتفلیکس با توسعه «سطح‌بندی ذخیره‌سازی زمانی» (TimeSeries Tiered Storage) توانسته است حجم عظیمی از داده‌های زمانی چندپتابایتی را با کارایی بالا مدیریت کند. در این سیستم، داده‌های قدیمی‌تر و غیرقابل تغییر که دیگر نیازی به دسترسی سریع ندارند، از حافظه گرم در کاساندرا به ذخیره‌سازی ارزان‌قیمت‌تر مانند S3 منتقل می‌شوند. این استراتژی به کاهش هزینه‌ها و استفاده بهینه از منابع زیرساختی کمک می‌کند، در حالی که سرعت بازیابی داده‌های قدیمی‌تر همچنان مناسب است. در نسخه اولیه این سیستم، از فناوری‌هایی مانند کافکا و فلینگ بهره گرفته شد. داده‌ها در قالب پارکت به‌وسیله این ابزارها در حالتی پیوسته و مداوم به سمت S3 هدایت می‌شدند و روزانه عملیات فشرده‌سازی مجدد بر روی داده‌ها انجام می‌گرفت. این رویکرد امکان ارائه خوانش‌های سرد با کم‌ترین تأخیر حدود ۵۰۰ میلی‌ثانیه در سطح p۹۹ را فراهم می‌کرد، ولی در عین حال، هزینه عملیاتی آن بسیار بالا بود و نیازمند زیرساخت‌های قدرتمند و نگهداری مداوم بود. در اصلاحات بعدی، نتفلیکس تصمیم گرفت تا از قابلیت‌های بومی کاساندرا برای خوانش در سطح سرد بهره‌مند شود. این سامانه به طور مستقیم از نسخه‌های پشتیبان S3، که حاوی داده‌های فشرده سرد هستند، خوانش می‌کند. این رویکرد نه تنها حجم داده‌هایی که می‌توان مدیریت کرد را افزایش داد، بلکه زمان پاسخ‌دهی شدیداً بهبود یافته است؛ به‌طوری که latency سطح p۹۰ حدود ۳۰ درصد کاهش یافته است. این تغییرات، باعث شد که سیستم بتواند به طور مؤثرتری نیازهای عملیاتی و تحلیل‌های بزرگ‌مقیاس را برآورده کند، بدون اینکه هزینه‌ها و پیچیدگی‌ها افزایش یابند. در نتیجه، این مسیر تحول در ذخیره‌سازی داده‌های زمان‌بندی شده نمونه‌ای از نوآوری در حوزه داده‌های بزرگ است که توازنی هوشمندانه میان هزینه، کارایی و مقیاس‌پذیری برقرار می‌کند و به سازمان‌ها کمک می‌کند تا داده‌های تاریخی خود را به بهترین شکل مدیریت کنند. #ذخیره‌سازی_زمانی #کاساندرا #دیتای_بزرگ #مدیریت_داده 🟣لینک مقاله: https://netflixtechblog.medium.com/timeseries-tiered-storage-journey-kafka-flink-streams-to-native-cassandra-cold-reads-e59d597c9d60?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy0,00%
  • 14 авг.🔵 عنوان مقاله Dispatches from O'Reilly: The Best Risk Mitigation Strategy in Data? A Single Source of Truth (6 minute read) 🟢 خلاصه مقاله: در دنیای مدیریت داده‌ها، یکی از مهم‌ترین چالش‌ها، جلوگیری از تناقض در اعداد و اطلاعات است که می‌تواند کارایی و اعتماد به داده‌ها را زیر سوال ببرد. از همین رو، تعریف معیارها و معیارهای کلیدی فقط یک‌بار در لایه معنایی، راه‌حل موثری است تا اطمینان حاصل شود که تمامی ابزارهای تحلیل مانند Tableau، Power BI و نوت‌بوک‌ها، همگی بر اساس داده‌های یکسان و دقیق عمل می‌کنند. این رویکرد نه تنها خطر برخورد با ارقام متناقض را کاهش می‌دهد، بلکه فرآیند کنترل مجوزها و پیگیری تغییرات را از یک نقطه واحد ممکن ساخته و امکان ردیابی و حسابرسی ساده‌تر را فراهم می‌کند. در حقیقت، لایه معنایی نقش استراتژیک در کاهش ریسک‌های عملیاتی دارد و به عنوان یک لایه اختیاری شناخته نمی‌شود بلکه جزو اجزای ضروری سیستم‌های تحلیل و مدیریت داده است. با استفاده از این ساختار، سازمان‌ها می‌توانند با اطمینان بیشتری تصمیم‌گیری کنند و از صحت و ثبات داده‌هایشان در تمامی سطوح بهره‌مند شوند، چرا که تمامی تغییرات و مجوزهای مربوط به معیارها و داده‌ها، از یک مکان مرکزی قابل کنترل است و خطاهای احتمالی به حداقل می‌رسد. در نتیجه، استراتژی تک‌منبع حقیقت در داده‌ها، بهترین رویکرد برای کاهش ریسک‌های عملیاتی و افزایش شفافیت در مدیریت داده‌ها است، روشی که تضمین می‌کند تمامی اتصالات به داده‌های سازمان، بر پایه استانداردهای یکسان و قابل اعتماد صورت گیرد. #مدیریت_داده #کیفیت_اطلاعات #امنیت_داده #بهره‌وری_سیستم 🟣لینک مقاله: https://stackoverflow.blog/2026/07/31/dispatches-from-o-reilly-the-best-risk-mitigation-strategy-in-data-a-single-source-of-truth/?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy0,00%
  • 14 авг.🔵 عنوان مقاله pyhctsa: Python Toolkit for Highly Comparative Time-Series Analysis (GitHub Repo) 🟢 خلاصه مقاله: ابزار pyhctsa یک مجموعه قدرتمند و کارآمد در زبان پایتون است که برای تحلیل‌های جامع و پیوسته بر روی داده‌های سری زمانی طراحی شده است. این ابزار به کاربران امکان می‌دهد صدها ویژگی آماری و ساختاری مختلف را از یک یا چند سری زمانی استخراج کنند. یکی از مزایای مهم این مجموعه، قابلیت پیکربندی و سفارشی‌سازی مجموعه‌ ویژگی‌ها است که به محققان و تحلیل‌گران داده امکان می‌دهد بر اساس نیازهای خاص، ویژگی‌های دلخواه خود را اضافه یا تغییر دهند. علاوه بر این، pyhctsa قادر است ورودی‌های با طول‌های متفاوت را به خوبی مدیریت کند و در نتیجه، انعطاف‌پذیری بالایی برای تحلیل داده‌های متنوع دارد. این مجموعه ابزار همچنین از فراخوانی مستقیم عملیات و انجام تحلیل‌ها به صورت هم‌زمان بر روی هسته‌های پردازشی محلی CPU پشتیبانی می‌کند. این قابلیت باعث می‌شود روند تحلیل داده‌ها بسیار سریع‌تر و بهینه‌تر انجام شود، به ویژه در مواردی که حجم داده‌ها زیاد است یا نیاز است تحلیل‌های پیچیده و زمان‌بر انجام شود. به طور کلی، pyhctsa ابزاری قدرتمند و انعطاف‌پذیر است که فرآیند تحلیل سری‌های زمانی را آسان‌تر، سریع‌تر و قابل تنظیم‌تر می‌کند، و برای دانشمندان، محققان و تحلیل‌گران داده بسیار مفید است. #تحلیل_سری_زمانی #ابزار_پایتون #داده‌کاوی #پیشرفته 🟣لینک مقاله: https://github.com/DynamicsAndNeuralSystems/pyhctsa?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy0,00%
  • 14 авг.🔵 عنوان مقاله SQL Improvements in Postgres 11–18: A Personal Selection 🟢 خلاصه مقاله: در نسخه‌های ۱۱ تا ۱۸ پستگرس، شاهد پیشرفت‌های قابل توجهی در بخش‌های مختلف SQL بوده‌ایم. این نسخه‌ها هشت انتشار مختلف را در بر می‌گیرند که هر کدام ویژگی‌های جدید و بهبودهای ویژه‌ای را به همراه داشته‌اند. در این مقاله، یک متخصص دیرینه در توسعه پایگاه‌های داده، مهم‌ترین ویژگی‌های این دوره‌ها را بر اساس موضوعات مختلف انتخاب و دسته‌بندی کرده است. یکی از بخش‌هایی که قطعاً توجه‌ها را جلب می‌کند، مدل‌سازی عضویت در گروه‌ها در طول زمان است. ابزارهای جدید مانند tstzmultirange و تابع range_agg() امکانات بی‌نظیری را در این حوزه فراهم کرده‌اند. این ابزارها به توسعه‌دهندگان اجازه می‌دهند تحلیل‌های پیچیده‌تری بر روی تغییرات عضویت در گروه‌ها انجام دهند و روندهای تاریخی را به شکل موثرتری نشان دهند. اگر به دنبال درک بهتر نحوه مدیریت و تحلیل عضویت‌های زمانی در پایگاه داده‌های خود هستید، مطالعه این قسمت ارزش زیادی دارد. در کل، نسخه‌های ۱۱ تا ۱۸ پستگرس مجموعه‌ای غنی از قابلیت‌های جدید ارائه می‌دهند که کار با SQL و مدل‌سازی داده‌ها را ساده‌تر، سریع‌تر و قدرتمندتر می‌کنند. مطمئناً این تحولات می‌توانند تاثیر قابل توجهی در پروژه‌های داده‌محور شما داشته باشند. #پستگرس #SQL #پایگاه_داده #توسعه 🟣لینک مقاله: https://tapoueh.org/blog/2026/07/sql-improvements-in-postgresql-1118-a-personal-selection/ ➖➖➖➖➖➖➖➖ 👑 @Database_Academy0,00%
  • 13 авг.🔵 عنوان مقاله How and Why Netflix Built a Real-Time Distributed Graph: Part 3 — Querying the graph with gRPC execution API (20 minute read) 🟢 خلاصه مقاله: در قسمت سوم مقاله “چگونه و چرا نتفلیکس یک گراف توزیع‌شده در زمان واقعی ساخت”، به بررسی نحوهٔ پرس‌وجو از این گراف با استفاده از API اجرای gRPC می‌پردازیم. در این بخش، تمرکز بر روی سازوکارهای تکنولوژیکی و کارایی سیستم است که نتفلیکس در پردازش میلیاردها نود و میلیاردها یال به کار می‌گیرد. شبکه پرس‌وجوی لرزه‌نگار نتفلیکس (RDG) قادر است با بهره‌گیری از پارالل‌سازی مرحله‌ای، در هر نمونه سیستم، بین ۱۶ تا ۲۴ رشته‌ اجرای ناهمزمان (async) را فعال کند. این رویکرد باعث می‌شود عملیات پرس‌وجو بتواند بسیار سریع انجام شود و در عین حال، سیستم بتواند حجم گسترده‌ای از داده‌ها را در کوتاه‌ترین زمان ممکن مدیریت کند. این ساختار برای پاسخ‌دهی به درخواست‌ها، سطوح حافظه‌پنهان (کَش) را با توجه به نوسانات داده‌ها تنظیم می‌کند، به طوری که نرخ برخورد (hit rate) در موارد داده‌های پایدار به ۷۰ تا ۸۰ درصد می‌رسد. این امر در نتیجه باعث کاهش قابل توجه زمان پاسخ‌ها می‌شود؛ به عنوان نمونه، حتی پرس‌وجوهای چندهاپی (سه‌گام) در کمتر از ۱۵۰ میلی‌ثانیه در حالت معمول اجرایی می‌شوند، آن هم در مسیرهای دروازه‌زن (P99) که سخت‌ترین حالت‌ها را نشان می‌دهند. در نتیجه، این معماری مقیاس‌پذیر و بهینه، نتفلیکس را قادر ساخته است که پرس‌وجوهای پیچیده در زمان واقعی را با کارایی بالا و کمترین تأخیر ممکن انجام دهد، که این دقیقا نیاز این پلتفرم بزرگ در ارائه خدمات بی‌وقفه و سریع است. #گراف_پرس‌وجو #زمان_واقعی #پایگاه_داده #نتفلیکس 🟣لینک مقاله: https://netflixtechblog.com/how-and-why-netflix-built-a-real-time-distributed-graph-part-3-querying-the-graph-with-grpc-0f3468349607?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy0,00%
  • 13 авг.🔵 عنوان مقاله Data lessons from inside Meta (Shridhar Iyer) (12 minute read) 🟢 خلاصه مقاله: امپراتوری داده‌های متا به سمت اتحاد و سازماندهی بهتر حرکت کرده است. پلتفرم داده‌های این شرکت اکنون به یک ساختار منسجم و قوی تبدیل شده است که شامل لایه‌های متعددی مانند کاتالوگ متمرکز، طبقه‌بندی، روابط اولیه و سیاست‌های مدیریت اطلاعات است. این تحول بزرگ باعث شده است که مدیریت داده‌ها راحت‌تر، کارآمدتر و قابل کنترل‌تر باشد، و تیم‌های مختلف بتوانند به راحتی به داده‌های مورد نیاز دسترسی پیدا کنند و فرآیندهای تحلیلی را سریع‌تر انجام دهند. در مسیر توسعه این سیستم، متا با درس‌های مهمی درباره مقیاس و هزینه‌ها روبه‌رو شده است. یکی از این درس‌ها این بود که حذف یا اصلاح سریع ستون‌های خطایابی کوتاه، توانسته است صرفه‌جویی‌های زیادی در هزینه‌ها ایجاد کند؛ به طوری که تنها با کاهش چندین ستون، میلیون‌ها دلار صرفه‌جویی شد. همچنین، برای جداول اصلی که بخش قابل توجهی از پایگاه داده‌ها را تشکیل می‌دهند، به جای حذف کردن نسخه‌ها، روی نسخه‌بندی آن‌ها تمرکز شد تا تاریخچه تغییرات حفظ شده و عملیات بهبود‌یافته‌تر انجام شود. این رویکرد، علاوه بر حفظ داده‌های حیاتی، کارایی سیستم را نیز افزایش داد. در نهایت، متا به سمت هوش مصنوعی و قابلیت‌های پیشرفته‌تر پیش می‌رود؛ اما این مسیر با ساختارهای کاری قابل استفاده مجدد و اصول اولیه فرآیندهای کاری شروع می‌شود. پایه‌گذاری روندهای قابل تکرار و استانداردسازی فرآیندها، نقطه شروع مهمی است تا بتوان سیستم‌های هوشمند و یادگیری ماشین را به طور مؤثر توسعه داد. در مجموع، درس‌های متا نشان می‌دهد که توسعه و مدیریت داده‌ها در مقیاس بزرگ نیازمند ساختار منسجم، تصمیمات هوشمندانه و تمرکز بر استانداردسازی است. #داده #مدیریت_داده #هوشمندسازی #پایگاه_داده 🟣لینک مقاله: https://roundup.getdbt.com/p/data-lessons-from-inside-meta-shridhar?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy0,00%
  • 13 авг.🔵 عنوان مقاله The Art of PostgreSQL 🟢 خلاصه مقاله: در دنیای پایگاه‌های داده، PostgreSQL به عنوان یکی از قدرتمندترین و پرکاربردترین سیستم‌ها شناخته می‌شود. یکی از ویژگی‌های مهم آن، توانایی تنظیم و بهینه‌سازی کوئری‌ها برای افزایش بهره‌وری است. اخیراً، محققان و توسعه‌دهندگان ابزارهای متنوعی برای تسهیل این فرآیند توسعه داده‌اند. یکی از پیشرفت‌های جالب، ارائه ابزارهای خودکار است که به صورت برنامه‌های مستقل یا کدهای کمکی ساخته شده‌اند تا بتوانند به صورت خودکار کوئری‌های PostgreSQL را بهینه کنند. در این میان، یک ابزار نوشته شده با زبان Go وجود دارد که وظیفه به‌کارگیری این بهینه‌سازی‌ها را به صورت خودکار بر عهده دارد. این ابزار کارآمد، با تحلیل کوئری‌های شما، به صورت هوشمندانه پیشنهاداتی ارائه می‌دهد و در نهایت، تغییرات لازم را بر روی کوئری‌ها اعمال می‌کند. این روش، نه تنها خطاهای انسانی در به‌کارگیری بهینه‌سازی‌ها را کاهش می‌دهد، بلکه فرآیند توسعه و بهبود عملکرد پایگاه داده‌ها را بسیار سریع‌تر و ساده‌تر می‌سازد. علاوه بر این، یکی از قابلیت‌های مهم این ابزار، وجود نسخه تحت وب آن است. با استفاده از این نسخه، می‌توانید بدون نیاز به نصب نرم‌افزارهای پیچیده، به راحتی روی مرورگر وب کار کنید و کوئری‌های خود را قبل از اجرا، به خوبی تست و بهینه‌سازی کنید. این قابلیت، به ویژه زمانی که در حال آماده‌سازی ارائه، مقاله یا پروژه‌های آموزشی هستید، بسیار مفید است. بنابراین، اگر به دنبال راهی سریع و مطمئن برای بهبود کارایی کوئری‌های PostgreSQL خود هستید، حتماً این ابزار را امتحان کنید. در نهایت، بهره‌گیری از ابزارهای خودکار و آنلاین، گامی مهم در مسیر توسعه و مدیریت بهتر پایگاه‌های داده است که می‌تواند چشم‌اندازهای جدیدی را برای توسعه‌دهندگان فراهم آورد و فرآیندهای کاری را بسیار هوشمندانه‌تر و کارآمدتر کند. #پایگاه_داده #PostgreSQL #برنامه_نویسی #توسعه 🟣لینک مقاله: https://theartofpostgresql.com/ ➖➖➖➖➖➖➖➖ 👑 @Database_Academy0,00%
  • 13 авг.🔵 عنوان مقاله Microsoft almost gave away the keys to everyone's Azure Cosmos DBs (2 minute read) 🟢 خلاصه مقاله: اخیراً، یک هشدار جدی برای کاربران سرویس Azure Cosmos DB مایکروسافت به وجود آمده است. گزارشی منتشر شد که نشان می‌دهد در برخی موارد، پلتفرم‌های مدیریت‌شده NoSQL می‌توانند کلیدهای اصلی را در اختیار کاربران غیرمجاز قرار دهند. این موضوع یک یادآوری مهم است که حتی سیستم‌های امن و مدیریت‌شده نیز در معرض خطر افشای کلیدهای حساس قرار دارند. در واقع، وجود چنین مشکلاتی نشان می‌دهد که سازمان‌ها باید همواره سیاست‌های امنیتی مربوط به نگهداری و مدیریت کلیدهای رمزنگاری را بازبینی و به‌روزرسانی کنند. اطمینان از دوره‌ای بودن فرآیندهای چرخش کلیدها و بررسی منظم مجوزها و سیاست‌های دسترسی از نکات حیاتی است که باید جدی گرفته شود. صرف نظر از سطح اطمینان به سرویس‌های ابری، رعایت پروتکل‌های امنیتی و نظارت مداوم بر وضعیت امنیتی، کلیدواژه‌های کلیدی در حفظ حریم خصوصی و سلامت سیستم‌ها هستند. در مجموع، این حادثه نشان می‌دهد که سازمان‌ها نباید فریب امنیت ظاهری سرویس‌های ابری را بخورند و باید همواره به رویکردهای امنیتی فعال و به‌روزرسانی مداوم سیاست‌ها متعهد باشند تا در برابر تهدیدهای بالقوه مصون بمانند. #امنیت_ابری #کلیدهای_رمزنگاری #امنیت_سایبری #پایش_امنیت 🟣لینک مقاله: https://www.infoworld.com/article/4203930/microsoft-almost-gave-away-the-keys-to-everyones-azure-cosmos-dbs-2.html?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy0,00%