آغاز عصر هوش مصنوعی انسان گونه با رونمایی از مدل جدید OpenAI
اوپنایآی با هیاهوی فراوان از مدل هوش مصنوعی پرچمدار GPT-6 Astra رونمایی کرد و گفت که وارد عصر AGI (هوش مصنوعی انسانگونه) شدهایم.

اوپنایآی از تازهترین مدل زبانی بزرگ خود با نام GPT-۶ Astra پرده برداشت؛ مدلی که آن را جهشی نسلی در حوزههایی مانند امنیت سایبری، کارهای حرفهای، مهندسی نرمافزار، علم و استفاده از کامپیوتر توصیف میکند.
این رونمایی تنها یک معرفی فنی نبود و خیلی زود به بحثی بزرگتر دربارهی «عصر AGI» گره خورد؛ جایی که گرگ براکمن و دیگر مدیران اوپنایآی کوشیدند نشان دهند مدل تازه هم توانمندتر شده و هم تحت کنترل سختگیرانهتری قرار دارد.
شرکت میگوید GPT-6 Astra نخستین مدلی است که به «آستانهی حیاتی توانمندی سایبری» رسیده، هرچند همزمان وعده میدهد چنین قابلیتی به تکرار رخدادهای اخیر منجر نخواهد شد.
گریگ براکمن، رئیس اوپنایآی، در نشستی خبری گفت اگر چند سال بعد به عقب برگردیم و بپرسیم هوش مصنوعی عمومی (AGI) واقعا چه زمانی شکل گرفت، احتمالا پاسخ به همین بازهی زمانی و شاید همین مدل برمیگردد. او بعدتر هم تصریح کرد که اکنون را میتوان بخشی از «عصر AGI» دانست و در انتهای جملاتش خطاب به خبرنگاران گفت: «به عصر AGI خوش آمدید.»
این رونمایی، بیش از یک سال پس از انتشار GPT-۵ و نزدیک به دو ماه پس از عرضهی GPT-۵.۶ انجام شد. عرضهی GPT-۶ Astra از امروز برای مشتریان سازمانی امنیت سایبری اوپنایآی آغاز شده و به گفتهی براکمن، طی چند روز آینده برای همهی کاربران Plus و Pro و Business و Enterprise هم فعال میشود.

اوپنایآی در معرفی Astra بیش از هر چیز روی تواناییهای عاملمحور و مهارت در کدنویسی تکیه کرد؛ تلاشی روشن برای جذب مشتریان سازمانی و رقابت مستقیم با آنتروپیک، رقیبی که در بازار سازمانی و ابزارهای برنامهنویسی جایگاه پررنگی دارد و اوپنایآی پیش از عرضهی عمومی سهامش هم بهدنبال نزدیکشدن به آن است.
بر اساس بیانیهی شرکت، GPT-۶ Astra میتواند وظایف چندمرحلهای عاملمحور را انجام دهد، وبسایتهای کاربردی بسازد و اسناد، جدولها و ارائههای «صیقلخورده» تولید کند. اوپنایآی همچنین آن را «بهترین مدل خود برای مهندسی نرمافزار» خواند و مدعی شد در کار با کدبیسهای واقعی و پیچیده، عملکرد قویتری دارد.
در ویدئوی تبلیغاتی شرکت، مسیری از یک دمو قدیمی دههی ۱۹۸۰ نشان داده شد که در آن کاربر از کامپیوتر میخواهد یک دایرهی زرد بکشد. بعد، روایت به امروز میرسد؛ جایی که کارمندان اوپنایآی با فرمان صوتی از Astra میخواهند همان دایره را به یک موشک، سپس به یک بازی سهبعدی کامل تبدیل کند و حتی یک آگهی در eBay بسازد. همهچیز فقط با ورودی صوتی پیش رفت.
منطق تجاری Astra روی «کار با کامپیوتر» بنا شده است. اوپنایآی میگوید مدل میتواند فرمهای آنلاین را پر کند، رکوردهای CRM را بهروزرسانی کند، تقویمها را سامان دهد، جستوجوی وب انجام دهد و نتیجه را در سند یا ایمیل بنویسد. همچنین از کار با صفحهگستردهها، تحلیل دادههای علمی در دفترچههای پایتون، کار در Power BI، ساخت و آزمایش وبسایت، اجرای نرمافزارهای مهندسی مانند KiCad و FreeCAD و حتی نصب و عیبیابی نرمافزارها صحبت شده است.
همین مجموعه تواناییها، بهگفتهی شرکت، میتواند معماری رایج هوش مصنوعی سازمانی را تغییر دهد. در سالهای اخیر، کسبوکارها ناچار بودند مدلها را با API، افزونه، سیستمهای بازیابی و ابزارهای اختصاصی به سیستمهای داخلی وصل کنند. براکمن استدلال کرده که عاملهای مبتنی بر کار با کامپیوتر شاید بخشی از این لایهی اتصال را دور بزنند، چون نرمافزارها از قبل یک رابط عمومی در اختیار دارند؛ همان رابطی که انسان استفاده میکند.
او در نشست خبری گفت کاربران و شرکتها در «یک عصر عظیم» با تنگناهایی روبهرو بودهاند که از نوشتن کانکتورها و ساختن اتصالهای دقیق برای ابزارهای مختلف ناشی میشود. بهگفتهی او، اگر مدل بهاندازهی کافی توانمند باشد، میتواند «از میان صفحهگستردهها عبور کند، فرمها را پر کند و میان صفحات وب حرکت کند.»
براکمن همچنین یادآوری کرد که این ایده به روزهای نخست اوپنایآی برمیگردد؛ زمانی که پژوهشگران دربارهی آموزش عاملی فکر میکردند که بر همان ورودیها و خروجیهای انسانیِ کار با کامپیوتر تکیه کند؛ یعنی پیکسل، کیبورد و ماوس. او گفت احساس میکند شرکت «نخستین عاملی را به دست آورده که واقعا میتواند این کار را انجام دهد» و انجام آن را بهشکلی بسیار مفید ممکن میسازد.
اوپنایآی گزارش داده که Astra در یک زیرمجموعهی آفلاین از OSWorld ۲.۰ امتیاز ۷۲٫۶ درصد را ثبت کرده، در حالی که برای هر وظیفه حدود ۴۰ دقیقه زمان برده است. در مقایسه، GPT-۵.۶ Sol به ۶۵٫۷ درصد رسیده و حدود ۷۵ دقیقه برای هر وظیفه نیاز داشت. از نگاه زمانی، Astra نزدیک به ۴۷ درصد سریعتر عمل کرده است.
شرکت همچنین نشان داد مدل میتواند کارهایی از ساخت یک بازی سهبعدی تا آمادهسازی یک توافقنامهی حقوقی را انجام دهد و همزمان درخواستهای نامرتبط دیگری را هم مدیریت کند. پیام کلی روشن بود. Astra قرار نیست فقط یک چتبات ساده باشد.
میا گلیس، پژوهشگر اوپنایآی، در نشست گفت کاربران با Astra «قابلیتهایی در نوک انگشتان خود دارند» که کمتر از یک سال پیش دور از دسترس به نظر میرسید. او توضیح داد که با چنین تواناییهایی، مردم میتوانند کارهای پیچیدهتری را در چند برنامه به مدل بسپارند و خودشان در سطحی بالاتر هدایت کار را بر عهده بگیرند.
بهنظر میرسد همین جابهجایی، از «پرامپتدادن به هوش مصنوعی» به «نظارت بر هوش مصنوعی»، برای کسبوکارها مهمتر از یک جهش دیگر در بنچمارکهای آکادمیک باشد.
عددها، ادعاها و جهش آموزشی
آیدن کلارک، پژوهشگر اوپنایآی، در این نشست Astra را حاصل بزرگترین جهش آموزشی تاریخ شرکت توصیف کرد. بهگفتهی او، این مدل نخستین مدل OpenAI است که با بیش از ۱۰۰٬۰۰۰ واحد در زیرساخت Stargate آموزش دیده و نخستین مدلی است که در آن، مدلهای قبلی نقش عمدهای در نظارت بر آموزش نسل بعدی داشتهاند.
کلارک گفت بر اساس ارزیابیهایی که در مرحلهی پیشآموزش دنبال شدهاند، جهش از Sol به Astra بزرگتر از جهشی است که Sol نسبت به مدلهای قبلی نشان داده بود. اوپنایآی رشد Astra را نتیجهی ترکیب پیشآموزش در مقیاس بزرگ و یادگیری تقویتی میداند؛ رویکردی که برای آموزش اتصال اطلاعات و اجرای وظایف بلندمدتتر طراحی شده است.
عددهای بنچمارک هم پررنگ هستند. اوپنایآی برای Astra امتیاز ۹۷٫۶ درصد در FrontierMath Tier ۴ v2 و ۷۴٫۱ درصد در DeepSWE v1.۱ و ۹۵٫۹ درصد در BenchCAD و ۹۶ درصد در GPQA Diamond و ۱۰۰ درصد در ExploitBench را گزارش کرده است. همچنین گفته این مدل در ARC-AGI-۳ به ۹۸٫۶ درصد رسیده است.
اما همین عدد آخر، با یک قید مهم همراه است و به یک مشکل بزرگتر در زبان صنعت هوش مصنوعی اشاره میکند. ARC-AGI از جدیترین تلاشها برای سنجش توان تعمیم به مسائل ناآشنا به شمار میرود، نه صرفا بازتولید مهارتهای حفظشده در آموزش.
در جدول امتیازهای کنونی ARC-AGI-۳، اجرای مدلهای مرسوم فاصلهی زیادی با عدد ۹۸٫۶ درصد ادعایی Astra دارد. با این حال، مقایسه ساده نیست. یادداشتهای ارزیابی اوپنایآی نشان میدهد Astra از Responses API harness شرکت استفاده کرده، در حالی که مدلهای مقایسهای ممکن است در پیکربندیهای متفاوتی اجرا شده باشند.
براکمن میگوید همه تعریف متفاوتی از AGI دارند و زمانی که اوپنایآی آغاز به کار کرد، تصور میشد لحظهای روشن و قابلتشخیص وجود داشته باشد که همه بگویند «این همان AGI است.» بهگفتهی او، چنین چیزی رخ نداده و موضوع بهمراتب خاکستریتر و مبهمتر از انتظار اولیه بوده است.
وقتی از او پرسیده شد آیا Astra خودش در محدودهی AGI قرار میگیرد، پاسخ شخصیاش محتاط نبود. او گفت از نظر خودش، «ما به آن نقطه رسیدهایم» و افزود که «استدلال قابلقبولی» برای چنین برداشتی وجود دارد.
غیبت GDPval و یک شکاف معنادار
یک نکتهی قابلتوجه در بنچمارکهای معرفی Astra غیبت GDPval بود؛ بنچمارک اختصاصی اوپنایآی برای سنجش عملکرد در کارهای واقعی و اقتصادی. این شرکت GDPval را در ۲۰۲۵ معرفی کرد تا از آزمونهای آکادمیک و بنچمارکهای کدنویسی فراتر برود و مدلها را روی ۱٬۳۲۰ وظیفهی برگرفته از ۴۴ شغل دانشی در ۹ صنعت بزرگ آمریکا بسنجد. خروجیهای این آزمون شامل گزارشهای حقوقی، طرحهای مهندسی، صفحهگستردهها، ارائهها، پشتیبانی مشتری و برنامههای مراقبت پرستاری میشود؛ یعنی بسیار نزدیک به همان جریان کاریای که اوپنایآی اکنون میگوید Astra میتواند خودکار کند.
همین غیبت، با توجه به قاببندی AGI، جلب توجه میکند. اوپنایآی در ابتدا GDPval را راهی برای زمینگیرکردن بحثهای مربوط به AGI و اثر اقتصادی در عملکرد قابلمشاهدهی محل کار معرفی کرده بود، نه در حد گمانهزنی. در توصیف رسمی خود هم گفته بود این بنچمارک برای ردیابی عملکرد مدلها در «وظایف واقعی و از نظر اقتصادی ارزشمند» ساخته شده تا تصویر روشنتری از نحوهی پشتیبانی از متخصصان در کار روزمره بدهد.
پس اگر اهمیت Astra در این باشد که سازمانها میتوانند کار بیشتری را بهطور معنادار به هوش مصنوعی واگذار کنند، GDPval یکی از مستقیمترین معیارهای داخلی اوپنایآی برای اثبات این ادعا به شمار میآید. نبودِ آن، البته نتیجههای دیگر Astra را باطل نمیکند، اما یک شکاف تحلیلی برجای میگذارد.
یک محدودیت مهم هم در خود GDPval وجود دارد که احتمالا توضیح میدهد چرا اوپنایآی آن را در صدر روایت Astra ننشانده است. نسخهی فعلی GDPval یکمرحلهای است و کارهای بلندمدت، تعاملی و چندبرنامهای را که Astra قرار است در آنها بهتر باشد، بهدرستی نمیسنجد. اوپنایآی خود گفته نسخههای آینده باید گردشکارهای تکرارشونده، زمینهی غنیتر و ابهام را هم در بر بگیرند. بنابراین، GDPval همزمان بسیار مرتبط با داستان سازمانی Astra است و تا حدی با جنبهی عاملمحورتر آن ناهماهنگ میماند.
با وجود این، در پرتو جملهی «عصر AGI» که براکمن به زبان آورد، نبودِ این عدد قابل چشمپوشی نیست. اگر ادعای عملیِ AGI روزبهروز بیشتر به توانایی هوش مصنوعی در انجام کارهای اقتصادی در حرفههای مختلف گره بخورد، GDPval یکی از صریحترین تلاشهای اوپنایآی برای سنجش دقیق همین موضوع به شمار میرود.
تا زمانی که نتایج Astra در آن آزمون یا در جانشینی که برای کارهای چندمرحلهای و عاملی طراحی شده، منتشر نشود، ادعاهای مربوط به تعمیم اقتصادی گستردهی آن بیشتر بر ترکیبی از بنچمارکهای تخصصی و نمایشهای زنده تکیه خواهد داشت تا بر پرچمدار خودِ شرکت برای سنجش کار واقعی.
سایهی هک هاگینگ فیس بر رونمایی Astra
رونمایی از Astra در حالی انجام شد که اوپنایآی هنوز در حال ترمیم تصویر خود پس از حادثهای پرحاشیه است؛ حادثهای مربوط به یک مدل منتشرنشده که به گفتهی شرکت، Astra نبود، اما از محیط محدود خود بیرون زد، سامانههای داخلی اوپنایآی را به خطر انداخت، راهی برای دسترسی به اینترنت پیدا کرد، روشی برای تبانی پنهانی عاملهای هوش مصنوعی ساخت و حتی به سامانههای هاگینگ فیس نفوذ کرد.
این اتفاق با شدت زیادی بازتاب پیدا کرد و بسیاری آن را به یک سقوط بزرگ در یک صنعت یا حتی یک فراخوان دارویی پرسروصدا تشبیه کردند. برای اوپنایآی، معرفی Astra میتواند از یک زاویه پیام مثبتی دربارهی قدرت مدلهایش در رقابت شتابگرفتهی هوش مصنوعی داشته باشد، اما از زاویهای دیگر، مسئلهی اعتمادپذیری را زیر سؤال میبرد.
شرکت در بیانیهای تأکید کرد Astra «ایمنترین مدل» تا امروز است و به کاربران کمک میکند «کارهای پیچیده را با حفظ نظارت» واگذار کنند. با وجود این، جیکوب پاچوکی، دانشمند ارشد اوپنایآی، به خبرنگاران گفت پیشرفت در هوش لزوما به پیشرفت در همراستاسازی منجر نمیشود و نظارت بر سامانههای هوش مصنوعی هر روز دشوارتر میشود.
اوپنایآی اکنون در وضعیتی حساس قرار دارد. سرمایهگذاران از شرکت میخواهند بالاخره به سود برسد یا دستکم درآمد بیشتری ایجاد کند، در حالی که رونمایی از Astra درست پس از موجی از انتقادها دربارهی هک هاگینگ فیس و نحوهی مدیریت آن انجام شده است.
نقش دولت و آموزش خودکارتر
اوپنایآی و رقبایش اخیرا پذیرفتهاند که دولت ترامپ، مدلهایشان را پیش از انتشار ارزیابی کند و Astra هم از این قاعده مستثنا نبود. براکمن به خبرنگاران گفت شرکت آزمونهای استاندارد را همراه با دولت انجام داده و از سوی طرف مقابل، دربارهی گاردهای ایمنی یا موارد مشابه، درخواستی برای تغییر مطرح نشده است.
آیدان کلارک، معاون پژوهش و آموزش اوپنایآی، Astra را نخستین مدل این شرکت دانست که مدلهای قبلی در نظارت بر آموزش آن نقش «بزرگی» داشتهاند. او به روندی اشاره کرد که به مفهوم بحثبرانگیز «خودبهبودی بازگشتی» نزدیک میشود؛ جایی که سامانههای هوش مصنوعی بخشهایی از آموزش، کدنویسی و حتی ساخت نسخههای پیشرفتهتر خود را بدون دخالت مستقیم انسان پیش میبرند.
کلارک گفت آموزش یک مدل پرچمدار، زمانی بهمعنای بیدارماندن در همهی ساعتهای شب، بازیابی کارها پس از خطاهای سختافزاری و از دسترفتن زمانهای طولانی برای اشکالزدایی بود. اما به گفتهی او، تا پایان آموزش Astra، روند کار به شکلی معمولی جلو میرفت که میشد بخش بزرگی از یک روز را بدون وقفه گذراند و اگر هم مشکلی پیش میآمد، مدل اغلب فقط پس از چند ثانیه توقف دوباره پیش میرفت.
منبع: زومیت



