گراف حذف: راهنمای عملی پاک‌سازی داده در سامانه‌های هوش مصنوعی

ت

تیم ژرف ای‌آی

۱۲ مرداد ۱۴۰۵۱۴ دقیقه مطالعه
گراف حذف: راهنمای عملی پاک‌سازی داده در سامانه‌های هوش مصنوعی

فردی می‌خواهد گفت‌وگویش با واحد پشتیبانی پاک شود. ردیف اصلی حذف می‌شود، اما پیوست‌ها در فضای ذخیره‌سازی شیء باقی می‌مانند. قطعه‌های متن در نمایه برداری زنده‌اند، خلاصه گفت‌وگو در مجموعه ارزیابی قرار دارد، متن آن وارد نسخه داده آموزش تکمیلی شده و یک نسخه پشتیبان می‌تواند هفته بعد همان ردیفِ ظاهراً حذف‌شده را برگرداند. سامانه تیکت موفقیت را اعلام می‌کند، درحالی‌که سامانه هوش مصنوعی هنوز می‌تواند مشتقات آن رکورد را بازتولید یا مصرف کند.

این مسئله واقعی حذف است: کدام بازنمایی‌ها باید از بین بروند یا دیگر استفاده نشوند، کدام آثار باید دوباره ساخته شوند، چه زمانی تغییر مدل لازم است و چه مدرکی برای بستن درخواست کفایت می‌کند؟ یک فرمان پایگاه داده پاسخ این پرسش‌ها نیست.

در این راهنما، پاک‌سازی یک گذار کنترل‌شده روی گراف تبار داده است. این یک الگوی مهندسی است، نه مشاوره حقوقی و نه ادعای اینکه هر درخواست مستلزم حذف مدل است. قانون قابل‌اعمال، هدف پردازش، مبنای حقوقی، استثناها، قراردادها و واقعیت سامانه همچنان تکلیف را تعیین می‌کنند. این الگو تصمیم را از متن سیاست به فرایندی اجرایی تبدیل می‌کند.

از تکلیف شروع کنید، نه از الگوریتم فراموشی

درخواست حذف از مسیرهای متفاوتی می‌رسد: حق فرد، پس‌گرفتن رضایت، پایان دوره نگهداشت، محدودیت مجوز، منبع آموزشی آلوده، رخداد امنیتی یا پایان هدف داخلی. این محرک‌ها هم‌معنا نیستند. پیش از دست‌زدن به هر اثر، مسئول حقوقی یا حریم خصوصی باید فرد یا مجموعه حذف، حوزه قضایی، سامانه‌ها و اهداف پردازشِ مشمول، معیار احراز هویت، مهلت، نگهداشت مجاز و هر الزام حفظ مدرک را مشخص کند.

برای نمونه، ماده ۱۷ مقررات عمومی حفاظت از داده اتحادیه اروپا در شرایط معین حق پاک‌شدن را مقرر می‌کند و هم‌زمان استثناهایی دارد. متن قانون نمی‌گوید هر مدل یادگیری ماشین مرتبط همیشه باید نابود شود. راهنمای فعلی دفتر کمیسر اطلاعات بریتانیا درباره حقوق افراد در سامانه‌های هوش مصنوعی نیز مطلق‌نبودن این حق را یادآور می‌شود. این راهنما حذف رکورد آموزشی را از حالتی جدا می‌کند که داده شخصی در مدل وجود دارد یا از آن قابل استنباط است؛ در حالت دوم ممکن است آموزش دوباره یا حذف مدل لازم شود. همان صفحه اعلام کرده پس از تغییر قانون بریتانیا در دست بازبینی است؛ بنابراین برای پرونده واقعی باید نسخه روز آن دوباره بررسی شود.

پرونده را با شناسه‌ای پایدار باز کنید. دامنه مجاز و استثناها را ثبت کنید، اما محتوای حساس را در تیکتی با دسترسی گسترده کپی نکنید. همه اقدامات فنی و نتایج اعتبارسنجی باید به همان شناسه ارجاع دهند.

حذف را به‌صورت گراف مدل کنید، نه فهرست پایگاه‌ها

خط لوله هوش مصنوعی یک رکورد را به بازنمایی‌های متعددی تبدیل می‌کند. در گراف مفید، گره‌ها محل‌های ذخیره و آثار هستند و یال‌های نوع‌دار تبدیل یا کپی را نشان می‌دهند:

support_record -> attachment -> parsed_text -> chunk -> embedding -> vector_index
                              -> redacted_summary -> evaluation_snapshot
                              -> training_snapshot -> adapter -> deployed_release
support_record -> prompt_log -> analytics_aggregate
all mutable stores -> backup_set -> restore_process

برای هر گره، مالک، شناسه سامانه، منطقه، حساسیت، قاعده نگهداشت، سازوکار حذف، ورودی‌های بازسازی، نسخه مستقر و روش راستی‌آزمایی را ثبت کنید. هر یال باید کار تولیدکننده، نسخه کد، زمان‌بندی و نسخه منبع را نام ببرد. آن‌گاه پرسش «این ردیف کجاست؟» به پرسش دقیق‌تر تبدیل می‌شود: «کدام گره‌های قابل‌دسترسی ممکن است مقدار، بازنمایی، اثر آموخته‌شده یا کپی بازیابی‌پذیر آن را داشته باشند؟»

پروفایل مولد NIST AI 600-1 که ژوئیه ۲۰۲۴ منتشر شده، مستندسازی منشأ و تبار محتوا، آزمون جریان و تبدیل داده، سیاست جمع‌آوری و نگهداشت، ثبت ملاحظات داده شخصی یا حساس در موجودی و توجه به نگهداشت، نشت و وابستگی‌ها هنگام ازرده‌خارج‌کردن سامانه را توصیه می‌کند. این راهنمای داوطلبانه مدیریت ریسک است؛ کامل‌بودن گراف یک سامانه خاص را اثبات نمی‌کند.

یک «تبار حریم خصوصی» جدا نسازید که از تولید واقعی فاصله بگیرد. همان موجودی دارایی و انتشارِ مورد استفاده عملیات را گسترش دهید. گذرنامه انتشار هوش مصنوعی می‌تواند پیکره، نمایه، مجموعه داده، آداپتر، سیاست پرامپت و ترکیب مستقر را مشخص کند؛ پرونده حذف، قابلیت ردیابی در سطح فرد و حالت مقصد را به آن می‌افزاید.

برای هر بازنمایی حالت مقصد تعریف کنید

«حذف‌شده» باید در هر لایه معنای مشخصی داشته باشد. واژگان عملی برای حالت مقصد چنین است:

حالت مقصدکاربرد مناسبآنچه اثبات نمی‌کند
برداشته‌شدهردیف منبع، فایل، قطعه متن، لاگ و ویژگیِ قابل‌تغییرپاک‌بودن کپی‌ها، پشتیبان‌ها یا مشتقات
دسترسی‌لغوشدهمجوز دسترسی، امکان بازیابی، مجوز محتوا و اتصال بیرونیناپدیدشدن بایت‌ها یا اثر آموخته‌شده
نامعتبرشدهکش، خلاصه تولیدی و نمای مادی‌شدهناتوانی کار بعدی در ساخت دوباره آن
بازسازی‌شدهنمایه، تجمیع، مجموعه ارزیابی و نسخه دادهپاک‌بودن مرز منبعِ بازسازی
آموزش‌دوباره‌دیدهآداپتر یا مدلی که مجموعه آموزش آن تغییر مادی کردهسروشدن اثر جدید در همه محیط‌ها
فراموش‌کردهمدلی که با روش حذف تعریف‌شده به‌روزرسانی شدههم‌ارزی کامل با مدلِ هرگز آموزش‌ندیده، مگر آنکه روش و شواهد چنین تضمینی بدهند
قرنطینه‌شدهرکورد زیر الزام حفظ حقوقی یا تحقیقپاک‌سازی؛ این نگهداشت محدود است

حذف از بازیابی‌های آینده اغلب با پاک‌کردن رکورد و قطعه‌های مرجع، ثبت شناسه منبع در فهرست منع، بازسازی نمایه و تخلیه کش شدنی است. این با حذف اثر آموزش از وزن‌ها تفاوت دارد. قانون امتناع یا فیلتر خروجی می‌تواند پاسخ شناخته‌شده‌ای را پنهان کند، اما بازنمایی زیرین را پاک نمی‌کند و شاید با پرامپت دیگری دور زده شود.

نظر ۲۸/۲۰۲۴ هیئت اروپایی حفاظت از داده در دسامبر ۲۰۲۴ می‌گوید مدل‌های آموزش‌دیده با داده شخصی را نمی‌توان خودکار ناشناس فرض کرد. آزمون موردی آن می‌پرسد آیا احتمال استخراج مستقیم و احتمال به‌دست‌آوردن داده شخصی از طریق پرس‌وجو، با توجه به ابزارهایی که استفاده از آن‌ها به‌طور معقول محتمل است، ناچیز محسوب می‌شود یا نه. این ارزیابی نظارتیِ ناشناس‌بودن است، نه یک آستانه عددی جهان‌شمول برای فراموشی ماشین.

یک اقدام نظارتی موردی در آمریکا نشان می‌دهد چرا مشتقات باید در گراف باشند. دستور نهایی Everalbum کمیسیون تجارت فدرال حذف عکس و ویدئوی مشخص، بردارهای چهره مشتق از داده زیستی و مدل‌ها یا الگوریتم‌های تعریف‌شده‌ای را که با آن اطلاعات ساخته شده بودند الزامی کرد. این پرونده قاعده همه سامانه‌ها نیست؛ اما نشان می‌دهد پاک‌کردن صرفِ ورودی خام می‌تواند راهکار ناقصی باشد.

کم‌اخلال‌ترین روش سازگار با مقصد را انتخاب کنید

از منبع مرجع آغاز کنید و همه یال‌های قابل‌دسترسی را بپیمایید. برای هر گره، روش را متناسب با پیامد و عدم‌قطعیت انتخاب کنید:

  1. حذف مستقیم وقتی رکورد آدرس‌پذیر است و حذف آن وظیفه حفظ مدرک را نقض نمی‌کند.
  2. سنگ‌قبر همراه فهرست منع وقتی خط‌های لوله ناهم‌زمان باید فوراً بدانند شناسه منبع دیگر مجاز نیست؛ سنگ‌قبر فقط حداقل شناسه و سیاست انقضا را حمل می‌کند.
  3. بی‌اعتبارسازی و بازسازی برای اثر مشتق‌شده، مانند قطعه، بردار، نمایه جست‌وجو، خلاصه، تجمیع و نسخه ارزیابی.
  4. آموزش دوباره از نسخه پاک وقتی اثر، نمونه‌های آموزش را ذاتاً در خود نگه می‌دارد، خطر استخراج مهم است یا حذف دقیق لازم و از نظر هزینه ممکن است.
  5. روش فراموشی تعریف‌شده فقط وقتی تضمین، فرض‌ها، افت کارایی و شیوه ممیزی آن با پرونده سازگار است. عبارت «با آموزش تکمیلی از یادش بردیم» تضمین نیست.
  6. خارج‌کردن یا جایگزینی انتشار وقتی تیم دامنه را نمی‌شناسد، به اثر تأمین‌کننده دسترسی ندارد یا نمی‌تواند مدرکی متناسب با ریسک تولید کند.

مقاله سال ۲۰۲۱ بورتول و همکاران با عنوان Machine Unlearning، چارچوب SISA یعنی آموزش قطعه‌بندی‌شده، جدا، برش‌خورده و تجمیع‌شده را معرفی کرد تا پس از درخواست حذف فقط بخشی از مدل نیازمند آموزش دوباره باشد. افزایش سرعت و افت محدود دقتِ گزارش‌شده به داده‌ها و معماری‌های همان مطالعه مربوط است؛ این نتایج یک مسیر طراحی را نشان می‌دهند، نه وعده آماده برای مدل‌های پایه.

درس ماندگار معماری است: پیش از نخستین درخواست، هزینه پاک‌سازی آینده را کاهش دهید. تا جای ممکن اثر هر فرد را بخش‌بندی کنید، نسخه‌های پاک و بازتولیدپذیر را نگه دارید، کارهای تبدیل را نسخه‌بندی کنید، اهداف نامرتبط را مخلوط نکنید، آداپترها را قابل‌جایگزینی بسازید و بدانید هر انتشار کدام اثر آموزشی را مصرف می‌کند.

حذف را در خط لوله و پشتیبان یک‌طرفه نگه دارید

اگر کار شبانه بتواند رکورد را بازتولید کند، درخواست هنوز ایمن نیست. یک دفتر فشرده حذف را جلوی همه مسیرهای ورود، تبدیل، آموزش، ارزیابی و بازیابی پشتیبان قرار دهید. کارها باید پیش از تولید مشتق جدید، شناسه منبعِ نامجاز را رد کنند. عملیات حذف باید هم‌توان باشد تا تکرار یا تلاش مجدد نتواند حالت مقصد را معکوس کند.

نسخه پشتیبان با مخزن زنده یکسان نیست. شاید نتوان پشتیبان تغییرناپذیر را بدون آسیب‌زدن به تاب‌آوری یا وظیفه حفظ مدرک، رکوردبه‌رکورد ویرایش کرد. زمان انقضا و مرز دسترسی آن را ثبت کنید، مسیر پردازش عادی را از خواندن آن منع کنید و در رویه بازیابی، پیش از سرو ترافیک سنگ‌قبرهای حذف را دوباره اعمال کنید. اگر سیاست به پاک‌سازی رسانه نیاز دارد، ویرایش دوم NIST SP 800-88 که سپتامبر ۲۰۲۵ منتشر شد، پاک‌سازی را ناممکن‌کردن دسترسی به داده مقصد در برابر سطح تلاش مشخص تعریف می‌کند و برنامه‌ای متناسب با حساسیت را پیشنهاد می‌دهد. دامنه آن رسانه و ذخیره‌سازی است؛ فراموش‌کردن اثر آموزشی در مدل را اثبات نمی‌کند.

اثبات را نگه دارید، نه محتوای پاک‌شده را. مسیر شواهد آماده ممیزی می‌تواند شناسه درخواست، دامنه مجاز، شناسه آثار متأثر، کارها یا فرمان‌ها، زمان‌ها، تأییدکنندگان، استثناها، خلاصه آزمون و هش انتشار پاک را حفظ کند. هش‌کردن مقدار شخصیِ قابل‌حدس نیز می‌تواند آزمون حدس را ممکن کند؛ پس هش را خودکار معادل ناشناس‌سازی ندانید.

نبودن، استفاده‌نشدن و استقرار را جداگانه بیازمایید

راستی‌آزمایی باید سه ادعا را پاسخ دهد:

  • نبودن: بازنمایی مقصد دیگر در گره‌هایی که باید پاک شوند وجود ندارد.
  • استفاده‌نشدن: فرایندهای بازیابی، آموزش، ارزیابی، تحلیل و بازگردانی نمی‌توانند آن را مصرف یا بازتولید کنند.
  • استقرار: همه محیط‌های سرو از اثر یا انتشار پاک استفاده می‌کنند.

در مخزن آدرس‌پذیر با شناسه پایدار منبع و مشتقات جست‌وجو کنید؛ تأخیر کپی‌ها، وضعیت کش، نسخه اشیا، صف‌های خطای پردازش و عضویت در نمایه را ببینید. پس از پایان عملیات دوباره گراف را بپیمایید تا گره‌هایی را که هنگام بازبودن پرونده ساخته شده‌اند بیابید. بازیابی پشتیبان را در محیط جدا تمرین کنید و پیش از فعال‌سازی، اعمال‌شدن سنگ‌قبرها را بسنجید.

راستی‌آزمایی مدل دشوارتر است. در صورت امکان، نامزد را با مبنایی که بدون مجموعه حذف آموزش دوباره دیده مقایسه کنید؛ آزمون استخراج، عضویت، کارایی وظیفه، برش‌های متأثر و پسرفت را اجرا کنید. آستانه‌ها را از پیش اعلام کنید و بذر تصادفی، پرامپت، تنظیم نمونه‌گیری و هش آثار را نگه دارید. عبور از یک پرامپت استخراج، چیز زیادی اثبات نمی‌کند.

پژوهش ژوئن ۲۰۲۶ گوگل درباره ممیزی فراموشی ماشین توضیح می‌دهد که وقتی دو مدلِ جداگانه بازآموزی‌شده خودشان متفاوت‌اند، مقایسه ساده دو نمونه می‌تواند گمراه‌کننده باشد. روش پیشنهادی، یک آزمون نسبی است: آیا مدل به‌روزشده به مرجع پاکِ بازآموزی‌شده نزدیک‌تر است یا به مدل اصلی؟ نویسندگان صریحاً هشدار می‌دهند آزمایش‌های ساده‌شده آن‌ها رتبه‌بندی تولیدی روش‌های فراموشی نیست. این دانش هنوز فعال و در حال تحول است؛ چند آزمون به کار ببرید و به‌جای صدور گواهی خیالی «اثر صفر»، عدم‌قطعیت باقیمانده را بیان کنید.

مثال عملی: حذف یک گفت‌وگوی پشتیبانی

فرض کنید دستیار پشتیبانی دوزبانه از گفت‌وگوهای حل‌شده بازیابی می‌کند و هر ماه یک آداپتر کوچک را با خلاصه‌های پذیرفته‌شده آموزش می‌دهد. درخواست ER-2048 یک گفت‌وگو و پیوست‌های مشتری را پوشش می‌دهد؛ یادداشت تحقیق تقلب باید با دسترسی محدود حفظ شود.

گرهاقداممدرک بستن
ردیف تیکت و پیوستفیلدهای مشمول حذف؛ یادداشت مجاز در قرنطینهشناسه تراکنش، نتیجه نسخه شیء، مجوز حفظ و سیاست دسترسی
متن استخراج‌شده، قطعه و بردارحذف با شناسه منبع؛ ثبت سنگ‌قبر پیش از تلاش مجدد کارهانتیجه صفر برای شناسه مشتق و آزمون موفق سنگ‌قبر
نمایه برداری و کش پاسخبازسازی بخش متأثر؛ بی‌اعتبارکردن کش کلیدی و معناییهش نمایه جدید و نبود بازیابی در پرسش‌های بازنویسی‌شده
نسخه ارزیابیتولید دوباره از فهرست منبع پاکهش نسخه و مقایسه تبار
نسخه آموزش و آداپترکنارگذاشتن رکورد؛ آموزش دوباره برش یا کل آداپتر طبق سیاستهش داده پاک، مدرک آموزش و آزمون کارایی و حریم خصوصی
دستیار مستقرارتقای انتشاری که نمایه و آداپتر پاک را نام می‌بردهش انتشار گزارش‌شده در محیط و مقصد بازگشت
پشتیباندر صورت مجازبودن فقط تا انقضای مقرر؛ اجرای سنگ‌قبر در بازیابیرکورد انقضا و تمرین بازیابی جداگانه

پرونده فقط وقتی بسته می‌شود که انتشار جدید همه‌جا فعال باشد و آزمون بازتولید همچنان پاک بماند. اگر آداپتر بازتولیدپذیر نیست یا تأمین‌کننده قادر به تغییر آن نیست، مسئول تصمیم باید خدمت را محدود، اثر را جایگزین، سامانه را خارج یا استثنای قانونی مستند کند؛ نباید فیلتر خروجی را به نام پاک‌سازی جا بزند.

نمایش حذف نسازید

حالت‌های شکست رایج قابل مشاهده‌اند:

  • فقط ردیف منبع حذف می‌شود. متن مشتق، بردار، خلاصه، لاگ و مجموعه آموزش باقی می‌ماند.
  • بازسازی از نسخه آلوده انجام می‌شود. نمایه زمان جدید دارد، اما همان ورودی ممنوع را حمل می‌کند.
  • امتناع معادل فراموشی فرض می‌شود. پرامپت شناخته‌شده مسدود است، درحالی‌که استخراج یا اثر آموخته‌شده باقی است.
  • کش معنایی نادیده می‌ماند. مشتق، کلید منبع ندارد و حذف کلید دقیق آن را پیدا نمی‌کند.
  • بازیابی، مسئله را برمی‌گرداند. رخداد بازیابی بحران، داده را زنده می‌کند چون دفتر سنگ‌قبر در راهنما نبود.
  • مدرک لازم نابود می‌شود. تیم هم محتوا و هم حداقل اثبات، الزام حفظ یا استثنای لازم برای نشان‌دادن رسیدگی مسئولانه را پاک می‌کند.
  • وضعیت تأمین‌کننده بدون هویت اثر پذیرفته می‌شود. «حذف انجام شد» به داده، مدل، منطقه، کپی یا انتشار خاصی متصل نیست.
  • آزمون مدل بیش‌ازحد تفسیر می‌شود. یک آزمون ضعیف عضویت یا پرامپت، تضمینی می‌شود که برای آن طراحی نشده است.

راهنمای کیفیت دانش RAG نشان می‌دهد شناسه مرجع منبع، چک‌سام، کنترل دسترسی و تازگی، هم نیاز بازیابی و هم پیش‌نیاز حذف‌اند. معماری حافظه سازمانی همین انضباط چرخه عمر را برای واقعیت‌های ذخیره‌شده، خلاصه‌ها و کنترل کاربر به کار می‌برد.

حلقه کنترل پاک‌سازی را عملیاتی کنید

سنجه‌هایی را دنبال کنید که رسیدن و ماندن سامانه در حالت مقصد را نشان می‌دهند:

  • پوشش تبار: گره‌های مشمول با سازوکار حذف آزموده‌شده تقسیم بر همه گره‌های مشمول کشف‌شده؛
  • تأخیر انتشار حذف: از مجازشدن درخواست تا اثبات حالت مقصد، به تفکیک نوع گره و صدک؛
  • شکست بازتولید: مشتق حذف‌شده‌ای که کار ورود، بازیابی پشتیبان یا آموزش دوباره ساخته است؛
  • پوشش انتشار پاک: محیط‌های سرو که هش انتشار پس از حذف را گزارش می‌کنند؛
  • کامل‌بودن راستی‌آزمایی: آزمون‌های لازم نبودن، استفاده‌نشدن، کارایی، حریم خصوصی، بازیابی و استقرار که نتیجه نهایی دارند؛
  • سن استثنا: الزام حفظ، محدودیت تأمین‌کننده یا اثر بازتولیدناپذیر برحسب مالک و تاریخ انقضا؛
  • بازگشایی درخواست: پرونده‌ای که پس از بسته‌شدن به‌دلیل کشف بازنمایی دیگری دوباره باز شده؛
  • تغییر کارایی فراموشی: تغییر وظایف باقی‌مانده و برش‌های حساس، در کنار شواهد انتخاب‌شده برای فراموشی.

نبود یک اثر پرخطر مدل را در درصدی آرامش‌بخش گم نکنید. ناشناخته‌های مهم باید به‌صورت دروازه تصمیم دیده شوند.

کار را با یک خط لوله واقعی و درخواست حذف مصنوعی آغاز کنید. گراف را رسم کنید، برای هر گره حالت مقصد بگذارید، یک رکورد را پاک کنید، آثار مشتق را دوباره بسازید، پشتیبان را در محیط جدا برگردانید، انتشار پاک را ارتقا دهید و تلاش کنید داده دوباره ظاهر شود. این تمرین نشان می‌دهد سازمان قابلیت پاک‌سازی دارد یا فقط یک دکمه حذف.

با ورود مدل، کش، مخزن، تأمین‌کننده، تبدیل، منطقه، هدف، قاعده نگهداشت یا فرایند بازیابی جدید، گراف را بازبینی کنید. حذف فقط وقتی کامل است که حالت مقصد مجاز در کل ترکیب قابل‌دسترسی منتشر شده باشد و پس از اجرای کار بعدی نیز برقرار بماند.

یادداشت منابع — بازبینی ۳ اوت ۲۰۲۶

#حذف داده#فراموشی ماشین#حاکمیت هوش مصنوعی#تبارشناسی داده#مهندسی حریم خصوصی

مطالب مرتبط

آماده شروع پروژه هوش مصنوعی خود هستید؟

با تیم ما تماس بگیرید و درباره نحوه کمک به کسب‌وکار خود صحبت کنید.