1 / 1 00:00
مهر ۱۴۰۵ · یه ماه هوش مصنوعی، خلاصه و خودمونی

AI Day

از مدل‌هایی که اصلاً حرف نمی‌زنن و فقط «تصمیم» می‌گیرن، تا ایجنت‌هایی که شب تا صبح بیدارن و برات کار می‌کنن. بیاید ببینیم سپتامبر ۲۰۲۶ چه خبر بود!

01

این یه ماه چه مدل‌هایی اومد؟

فقط تو سپتامبر حدود ۲۵ تا مدل جدید از ۱۶ تا شرکت اومد بیرون. یعنی تقریباً هر روز یکی! اینا مهم‌ترین‌هاشونن:

AnthropicSep 1

Claude Fable 5.1 · Mythos 5.1

نسل جدید مدل‌های سطح Mythos. Fable همون نسخه‌ایه که عموم مردم بهش دسترسی دارن.

GoogleSep 2

Gemini 3.8 Flash

جمینای سریع و ارزون، به‌اضافه‌ی یه نسخه‌ی مخصوص امنیت سایبری.

MetaSep 2

Muse Spark 1.3

مغز متفکر ایجنت Muse؛ مخصوص کارهای ایجنتی ساخته شده.

Sakana AISep 11

Fugu Ultra v2.0

نسخه‌ی جدید مدل اصلی آزمایشگاه ژاپنی Sakana.

TypeSafe AISep 15

Jev

مدلی که اصلاً متن نمی‌نویسه؛ فقط تصمیم می‌گیره! (بخش ۲)

AlibabaSep 18

Qwen3.8-Omni-Flash

یه مدل چندوجهی و فرز از خانواده‌ی Qwen.

xAISep 21

Grok 4.7

جدیدترین Grok، که از API هم در دسترسه.

OpenAISep 22

GPT-6 Luna

یه عضو تازه تو خانواده‌ی GPT-6.

Stanford + NVIDIASep 23

CLM-8B

اولین مدل تصمیم‌گیر اوپن‌سورس. (بخش ۶)

AnthropicSep 28

Claude Sonnet 5.5

تازه‌ترین مدل ماه، تا لحظه‌ای که این ارائه آماده شد.

OpenAISep 29

GPT-6.1 Sol

همین دیروز تو DevDay اومد: تقریباً هم‌قد GPT-6 Astra ولی خیلی ارزون‌تر.

یه مرور سریع، تو ۴۰ ثانیه
ویدیوی بخش ۱
02

Jev چیه و این «مدل تصمیم‌گیر» دقیقاً یعنی چی؟

Jev یه مدل زبانی معمولی نیست. نه متن می‌نویسه، نه کد، نه توضیح می‌ده چرا. یه «وضعیت» بهش می‌دی (متن یا JSON) با یه سؤال مشخص، اونم فقط یه جواب ساختاریافته با درصد اطمینان پس می‌ده. همین!

وضعیتمتن یا JSON
←
یه سؤال مشخصگزینه‌هاش رو خودت تو کد تعریف می‌کنی
←
Jevیه پاس، بدون نوشتن حتی یه کلمه
←
تصمیم + درصد اطمینانChoice · Score · Noul
مثلاً: «این تیکت مال کدوم تیمه؟» ← مالی (۹۲٪)، فنی (۵٪)، فروش (۳٪). نه یه پاراگراف توضیح، فقط جواب.

ایده‌ی اصلی: سیستم ۱ در برابر سیستم ۲

  • اسمش از کتاب «تفکر، سریع و کند» کانمن اومده: سیستم ۱ سریع و شهودیه، سیستم ۲ کند و حساب‌شده.
  • LLMها سیستم ۲ هستن. ولی بیشتر تصمیم‌های داخل نرم‌افزار (دسته‌بندی، مسیریابی، امتیازدادن) فقط یه جواب سریع سیستم ۱ لازم دارن.
  • مدل‌های معمولی کلمه‌به‌کلمه تولید می‌کنن؛ Jev کل جواب رو یه‌جا می‌ده.
  • اسم Jev هم از اقتصاددانی به اسم «جوونز» اومده: وقتی تصمیم ارزون بشه، تعداد تصمیم‌ها بیشتر می‌شه، نه کمتر.

سه مدل سؤال می‌شه ازش پرسید

  • Choice: یکی رو از بین گزینه‌ها انتخاب کن (تا ۲۵۵ تا گزینه)
  • Score: روی یه مقیاس مشخص، چند می‌دی؟
  • Noul: این جمله چقدر احتمال داره درست باشه؟
  • سازنده‌اش دیوگو آلمیداست، از آدم‌های پشت RLHF و ChatGPT تو OpenAI.
  • مدلش بازه؟ نه. فقط از طریق API می‌شه ازش استفاده کرد.

عددهایی که خود TypeSafe ادعا می‌کنه:

70–500ms
زمان جواب
$0.042
هر میلیون توکن ورودی؛ خروجی مجانیه!
~200×
سریع‌تر از LLMها
255
حداکثر تعداد گزینه
ولی یه نکته‌ی مهم: اینکه می‌گن «هالوسینیشن نداره» فقط یعنی از گزینه‌هایی که بهش دادی بیرون نمی‌زنه. یعنی ممکنه با اطمینان کامل گزینه‌ی غلط رو انتخاب کنه! تازه همه‌ی این عددها رو هم خود شرکت داده و هنوز کسی مستقل تکرارشون نکرده.
Jev تو ۴۵ ثانیه
ویدیوی بخش ۲
03

Jev به چه دردی می‌خوره؟ و ماجرای OpenRouter

یه قانون ساده: اگه خروجی‌ات متنه، برو سراغ LLM. اگه خروجی‌ات یه if تو کدته، مدل تصمیم‌گیر به کارت میاد.

پخش کردن تیکت‌ها

تو چند صد میلی‌ثانیه می‌گه هر تیکت مال کدوم تیمه و چقدر فوریه.

نگهبان ایجنت‌ها

قبل از اینکه ایجنت یه کار حساس بکنه، Jev تأیید می‌کنه. اگه مطمئن نبود، می‌ره سراغ آدم.

داور ارزون

جواب یه LLM دیگه رو چک می‌کنه. اگه دودل بود، کار رو می‌ده دست یه مدل گرون‌تر.

برچسب‌زنی انبوه

هزاران کامنت، فاکتور و متن رو با هزینه‌ی خیلی کم دسته‌بندی می‌کنه.

Jev Router چطوری کار می‌کنه؟

  • از ۲۵ سپتامبر رو OpenRouter فعاله و خود مسیریابش مجانیه.
  • قبل از هر پیام، Jev سختی و دقت لازم رو می‌سنجه، نه فقط نوع کار رو.
  • بعد تصمیم می‌گیره: مدل بزرگ‌تر لازمه؟ فکر بیشتر؟ یا یه مدل ارزون کافیه؟
  • حواسش به کش هست: فقط وقتی مدل رو عوض می‌کنه که سودش از هزینه‌ی از دست دادن کش بیشتر باشه.
  • فایل‌های پیوست هیچ‌وقت برای Jev فرستاده نمی‌شن؛ فقط متن مکالمه رو می‌خونه.

فرقش با Auto Router قبلی

  • Auto Router: مثل «شاخص بازار» کار می‌کنه. می‌بینه بقیه برای کارهای مشابه پول کدوم مدل رو می‌دن.
  • Jev Router: برای سختی همین درخواست، خودش جداگونه قضاوت می‌کنه.
  • روی ۴ بنچمارک ایجنتی: ۲۳۷ در برابر ۱۳۰ کار از ۴۲۳ تا؛ یعنی ۸۲٪ بیشتر.
  • روی Banking77، دقت Jev ۸۱٪ بود و Claude Opus 5 ۸۴.۴٪؛ ولی Jev حدود ۱۳ برابر سریع‌تر و ۲۲ برابر ارزون‌تر بود.
+82%
کار حل‌شده‌ی بیشتر از Auto
237 / 423
کارهای حل‌شده روی ۴ بنچمارک
$0
هزینه‌ی خود مسیریاب
ولی با احتیاط: این ۸۲٪ رو خود OpenRouter در مقایسه با مسیریاب قبلی خودش گزارش کرده. تو یه تست زنده هم مسیریاب برای یه سؤال ساده مثل «موز چه رنگیه؟» باز رفته بود سراغ مدل گرون! «مجانی» هم فقط مال خود مسیریابه؛ پول مدلی که انتخاب می‌کنه رو باید بدی. اگه Jev هم جواب نده، درخواستت کلاً شکست می‌خوره و به مسیریاب دیگه‌ای سپرده نمی‌شه.
مسیریابی هوشمند، تو ۵۰ ثانیه
ویدیوی بخش ۳
04

ایجنت‌های جدید: Muse · Grok Bot · Dots

سه تا غول تو کمتر از دو ماه تقریباً یه چیز ساختن: ایجنتی که کامپیوتر ابری مال خودش رو داره، کار رو از اول تا آخر انجام می‌ده و فقط برای «تأیید» برمی‌گرده سراغت.

Grok BotMuseDots
مال کیه؟xAI (SpaceXAI)MetaOpenAI
کِی اومد؟۱۱ اوت (بتا)۸ سپتامبر۲۹ سپتامبر، تو DevDay
مغزشGrok 4.6 / 4.7Muse SparkGPT-6 Astra
کجا کار می‌کنه؟یه کامپیوتر ابری مشترک برای همه‌ی بات‌هاماشین مجازی امن با مرورگری که خودت هم می‌بینیکامپیوتر و مرورگر ابری اختصاصی
نقطه‌ی قوتیه «تیم» بات که موازی کار می‌کنن؛ یه بار کار رو نشونشون بدی، یاد می‌گیرنآواتار شخصی، عینک هوشمند، یه جاکلیدی به اسم Muse Charmبیش از ۴۰۰۰ پلاگین؛ تو ChatGPT، اسلک و Teams کار می‌کنه
کی می‌تونه استفاده کنه؟مشترک‌های SuperGrok و Cursorرایگان با محدودیت، یا ۲۰ و ۱۰۰ دلار؛ آمریکا، کانادا، مکزیکChatGPT Pro و Business Premium
Grok Bot

از پروژه‌ی داخلی تا محصول

اول خود xAI برای فروش، بازاریابی و رفع باگ ازش استفاده می‌کرد. یه ماه بعد از عرضه به ۴۱۸ هزار کاربر هفتگی رسید.

Muse

ستاره‌ی استراتژی متا

زاکربرگ تو Connect گفت Muse محور استراتژی هوش مصنوعی متاست. یه ایجنت دیگه به اسم Sentinel قبل از اینکه هر کاری به اینترنت برسه، اون رو چک می‌کنه.

Dots

همکار، نه چت‌بات

وقتی کاری بهش نسپرده باشی، خودش با دسترسی فقط‌خوندنی دنبال یه کار به‌دردبخور می‌گرده. برای کارهای حساس هم ازت اجازه می‌گیره.

یه روند بامزه: هم Dots و هم Muse یه شخصیت کارتونی و آواتار دارن. شرکت‌ها دارن تلاش می‌کنن ایجنت رو «دوست‌داشتنی» و قابل‌اعتماد نشون بدن.
سه ایجنت، تو ۵۰ ثانیه
ویدیوی بخش ۴
05

ایجنت‌های ۲۴ ساعته

چت‌بات جواب می‌ده و تموم. ولی ایجنت همیشه‌روشن هدفت رو یادش می‌مونه، حواسش به تغییرها هست، کار رو ادامه می‌ده و فقط وقتی لازم باشه برمی‌گرده سراغت. حتی وقتی تو خوابی!

28%
تیم‌هایی که تو ۲۰۲۴ حداقل یه ایجنت شبانه‌روزی داشتن
71%
همین عدد تو ۲۰۲۶
3
غولی که تو ۲ ماه وارد این بازی شدن

یه ایجنت واقعاً ۲۴ ساعته چی داره؟

  • همیشه روشنه: رو سرور یا کامپیوتر ابری اجرا می‌شه، نه رو لپ‌تاپی که یادت رفته ببندیش
  • با اتفاق‌ها بیدار می‌شه: یه ایمیل، یه پیام، یه تغییر تو داده‌ها
  • حافظه داره: سلیقه و روش کارت رو یاد می‌گیره
  • قابل‌ردیابیه: لاگ و گزارش داره که بدونی چی‌کار کرده
  • تکرار خرابش نمی‌کنه: اگه یه کار دو بار اجرا بشه، گند نمی‌زنه

ولی ریسک‌هاش رو جدی بگیریم

  • ایجنت با رمزها و دسترسی‌های خود تو کار می‌کنه؛ هر اشتباهش واقعیه
  • تو Grok Bot همه‌ی بات‌ها یه کامپیوتر مشترک دارن؛ خود محصول بهش می‌گه «شعاع انفجار»!
  • یکی از پژوهشگرهای متا تعریف کرد که ایجنت OpenClaw بعد از گرفتن دسترسی ایمیل، فایل‌هاش رو از رو مک پاک کرده
  • گارتنر پیش‌بینی کرده بیشتر از ۴۰٪ پروژه‌های ایجنت تا ۲۰۲۷ شکست بخورن
یه شبانه‌روز از زندگی یه ایجنت
ویدیوی بخش ۵
06

نسخه‌های اوپن‌سورس هم هست؟

آره! برای هر دو موج این ماه، یعنی هم مدل‌های تصمیم‌گیر و هم ایجنت‌های همیشه‌روشن، یه جایگزین آزاد هست که رو سرور خودت بالا میاد.

به‌جای Jev

Stanford + NVIDIAApache 2.0

CLM-8B

اولین مدل تصمیم‌گیر اوپن‌سورس. رو یه دونه GPU اجرا می‌شه، API‌ش با Jev سازگاره و تا ۹ برابر سریع‌تر گزارش شده. نسخه‌ی ۳۵ میلیاردی‌اش هم تو راهه.

CommunityPyPI

jev-route

یه کتابخونه‌ی پایتون برای مسیریابی داخل کد. اگه اطمینان جواب کم باشه، کار رو می‌سپره به یه مسیر امن‌تر.

CommunityGitHub

pi-jev-router

برای ایجنت کدنویسی pi: برنامه‌ریزی رو می‌ده به مدل قوی، نوشتن رو به یه مدل فرز و ارزون.

به‌جای Muse، Grok Bot و Dots

Peter SteinbergerMIT

OpenClaw

پدربزرگ ایجنت‌های شخصی همیشه‌روشن و یکی از سریع‌ترین پروژه‌های تاریخ GitHub. کلی مهارت آماده داره، ولی مشکل امنیتی هم کم نداشته.

Nous ResearchMIT

Hermes Agent

ایجنتی که خودش خودش رو بهتر می‌کنه: حافظه‌ی عمیق، پشتیبانی MCP و کارهای زمان‌بندی‌شده. ابزار مهاجرت از OpenClaw هم داره.

NVIDIAOpen

NemoClaw

نسخه‌ی شسته‌رفته و امن‌تر OpenClaw برای شرکت‌ها، با سندباکس در سطح سیستم‌عامل.

CommunityLightweight

ZeroClaw · PicoClaw

نسخه‌های سبک برای سرورهای کوچیک، هوم‌لب و دستگاه‌های کم‌جون.

خلاصه‌اش: OpenClaw دنبال گستردگیه، Hermes دنبال عمق یادگیری. انتخاب با خودته.
بسته در برابر آزاد، تو ۴۰ ثانیه
ویدیوی بخش ۶
07

شرکت‌های هوش مصنوعی چطوری ارائه می‌دن؟

اگه همین یه ماه رو نگاه کنیم، یه الگوی مشخص تو معرفی محصول‌ها پیداست. طراحی همین صفحه هم از این سبک الهام گرفته 😉

۱. کی‌نوت زنده

OpenAI تو DevDay بیشتر از ۲۰ محصول رو یه‌جا معرفی کرد. متا هم Muse رو گذاشت وسط Connect.

۲. بلاگ + رشته‌توییت

یه پست بلاگ، یه رشته‌توییت، یه نمودار و یه لینک «همین الان امتحانش کن».

۳. یه عدد گنده

«۸۲٪ بیشتر»، «۲۰۰ برابر سریع‌تر». معمولاً بنچمارک خودشونه، پس با احتیاط!

۴. «اول خودمون استفاده کردیم»

Grok Bot و Dots هر دو با این داستان اومدن که اول تو خود شرکت ترکوندن.

۵. شخصیت و ماسکات

آواتار Muse و نقطه‌های کارتونی Dots؛ که ایجنت دوست‌داشتنی به نظر بیاد.

۶. عرضه‌ی قطره‌چکونی

اول بتا برای پلن‌های گرون، بعد کم‌کم برای همه. Grok Bot دو هفته بعد به پلن‌های ارزون هم رسید.

۷. کد + وزن + مقاله

اوپن‌سورس‌ها همه‌چیز رو یه‌جا منتشر می‌کنن؛ اعتبارشون از «قابل تکرار بودن» میاد.

۸. طراحی مینیمال

پس‌زمینه‌ی تیره، تایپوگرافی درشت، گرادیان نرم و ویدیوی کوتاه به‌جای اسلاید شلوغ.

۸ ترفند ارائه، تو ۵۰ ثانیه
ویدیوی بخش ۷
08

ویدیوهایی که Claude Opus 5.5 ساخته

نکته‌ی باحالش اینجاست: Opus 5.5 اصلاً مدل ساخت ویدیو نیست! کد می‌نویسه (HTML، CSS، JS، SVG، Three.js) و ابزارهایی مثل HyperFrames یا Remotion اون کد رو فریم‌به‌فریم به ویدیو تبدیل می‌کنن. صدا، موزیک و افکت‌ها هم با کد یا مدل‌های تبدیل متن به گفتار ساخته می‌شن.

پرامپت«یه ویدیوی لانچ ۱۵ ثانیه‌ای بساز»
←
Opus 5.5کد انیمیشن و صدا رو می‌نویسه
←
HyperFrames / Remotionفریم‌به‌فریم رندر می‌کنه
←
فایل MP4بدون حتی یه فریم فیلم واقعی
475
ویدیو تو مجموعه‌ی Skillry
288
موشن گرافیک
70
بازی و تعاملی
62
ویدیوی توضیحی
یه اعتراف: ویدیوهای بخش‌های ۱ تا ۷ همین ارائه هم دقیقاً همین‌طوری ساخته شدن؛ با کد، توسط هوش مصنوعی.
@stokebuilder0:16

۵۰ تا انیمیشن برای پادکست، حتی «Jev تو حقوق»!

برای یه قسمت پادکست، ۳۵ تا ۵۰ انیمیشن تمام‌صفحه ساخت تا مفهوم‌های سخت رو تصویری کنه. مستقیم به بخش ۲ ربط داره.

@HenriToivar0:43

بدون حتی یه عکس یا فیلم

همه‌چیزش، از انیمیشن تا موزیک و افکت، با کد خالص ساخته شده؛ اونم تو اولین تلاش. سازنده‌اش می‌گه با GPT-6 Astra و Grok 4.6 به این خوبی نشده بود.

@ik_builds0:15

ویدیویی که ۳۰۰۰ دلار قیمت داشت

برای این ویدیوی لانچ ۳۰۰۰ دلار قیمت داده بودن؛ Opus 5.5 با یه پرامپت ساختش. نمونه‌ی زنده‌ی بخش ۷.

@itsahmedharoon0:41

ابزارش رو خودش نصب کرد!

Claude خودش یه مدل متن‌به‌گفتار اوپن‌سورس دانلود و اجرا کرد، صدای توربین و افکت‌ها رو گذاشت و اینترو رو یه‌ضرب تحویل داد.

@_petert0:30

تیزر عینک VR متا

Opus 5.5 به‌اضافه‌ی HyperFrames، Gemini 3.8 Flash و Three.js؛ برای همون عینکی که تو Connect معرفی شد.

@TimGuignard0:25

یه پرامپت، یه ویدیو

تست Opus 5.5 با HyperFrames، با یه پرامپت که اونم هوش مصنوعی نوشته بود. خودش می‌گه با راهنمایی بیشتر خیلی بهتر هم می‌شه.

این ویدیوها اول از پوشه‌ی videos/opus/ خونده می‌شن و اگه اونجا نباشن، آنلاین پخش می‌شن.
09

خب، جمع‌بندی

سه تا چیز که یادمون بمونه

  • تصمیم گرفتن با حرف زدن فرق داره. مدل‌های جدیدی مثل Jev و CLM متن نمی‌نویسن؛ تصمیم‌های کوچیک و تکراری رو سریع و ارزون می‌گیرن.
  • مسیریابی هوشمند: دیگه لازم نیست همیشه بزرگ‌ترین مدل رو صدا بزنیم. هر درخواست می‌ره سراغ همون مدلی که واقعاً لازم داره.
  • از چت‌بات به همکار: Muse، Grok Bot و Dots ایجنت‌هایی با کامپیوتر خودشونن که شبانه‌روز کار می‌کنن.

و البته با یه کم احتیاط

  • بیشتر عددهای این ماه رو خود شرکت‌ها گزارش کردن.
  • ایجنت با دسترسی‌های تو کار می‌کنه، پس امنیت و تأیید آدمیزاد حیاتیه.
  • برای هر محصول بسته، یه رقیب اوپن‌سورس داره قد می‌کشه.

مرسی که همراهم بودید 🙏

راستش رو بخواید، این ارائه با کمک هوش مصنوعی آماده شده: از گشتن و جمع کردن منابع و نوشتن متن‌ها، تا طراحی صفحه و حتی ساختن ویدیوهای هر بخش.

اطلاعات تا ۸ مهر ۱۴۰۵ (۳۰ سپتامبر ۲۰۲۶) جمع شده و همه‌ی ادعاها به منبع اصلی‌شون لینک دارن. سؤالی هست؟

10

منابع و لینک‌ها