راهنمای استفاده از حالت صوتی جدید و طبیعیتر ChatGPT؛ مکالمهای روانتر و واقعیتر
دستیاران هوش مصنوعی مانند ChatGPT با سرعتی ثابت در حال پیشرفت هستند و با هر مدل جدید، قابلیتهای بیشتر، دقت بالاتر و پاسخهای سریعتری را ارائه میدهند.
به گزارش هفت صبح باید بدانید که هوش مصنوعی مولد بینقص نیست و نباید آن را منبعی بیچون و چرای اطلاعات دانست؛ اما برای کسانی که به این فناوری اعتماد کردهاند، گفتگو با صدا بسیار راحتتر از تایپ کردن تمام جزئیات است.
حالت صوتی اولیه ChatGPT که در سال ۲۰۲۳ عرضه شد، برای کارکردن به سه سیستم مجزا متکی بود: ابتدا صدای شما را به متن تبدیل میکرد، سپس پاسخ را با استفاده از یک مدل زبانی تولید میکرد و در نهایت از یک مدل «متن-به-گفتار» برای خواندن پاسخ استفاده میکرد.
پس از آن، «حالت صوتی پیشرفته» (Advanced Voice Mode) معرفی شد که با بهرهگیری از یک مدل تکحالت (Multimodal)، کیفیت کار را بهطور قابل توجهی بهبود بخشید. اکنون ChatGPT با مدل GPT-Live عرضه میشود که برای مدیریت گفتگوهای صوتی طراحی شده و گام بزرگی در جهت طبیعیتر شدن مکالمات است. OpenAI این ساختار را «Full-Duplex» (نیمهدوطرفه یا همزمان) مینامد؛ یعنی مدل میتواند همزمان هم گوش دهد و هم صحبت کند. این دقیقاً همان مشکلی را که در مدلهای قبلی داشتید حل میکند؛ یعنی آنجا که هوش مصنوعی مکثهای کوتاه شما را به معنای پایان صحبت تلقی میکرد و قبل از اینکه جملهتان تمام شود، شروع به پاسخ دادن میکرد.
حالا در حین صحبت، گاهی اوقات خواهید شنید که ChatGPT واکنشهای کوتاهی مثل «اِممم» (Mhmm) یا «آره» (Yeah) را میگوید؛ درست مثل یک انسان که در طول یک گفتگوی واقعی برای نشان دادن اینکه گوش میدهد، واکنش نشان میدهد. همچنین، اگر سوالی بپرسید که نیاز به استدلال یا تحقیق عمیق داشته باشد، GPT-Live میتواند در پسزمینه وظایف پیچیدهتر را به مدلهای توانمندتری مثل GPT-5.5 واگذار کند.
شروع گفتگو با GPT-Live
مدل صوتی GPT-Live در اپلیکیشن ChatGPT برای اندروید و iOS و همچنین در نسخه وب از طریق مرورگرها در دسترس است. کاربران نسخههای ChatGPT Pro، Plus و Go به مدل GPT-Live-1 دسترسی خواهند داشت، در حالی که کاربران نسخه رایگان از مدل سبکتر GPT-Live-1 mini استفاده میکنند. مدل GPT-Live اکنون جایگزین مدل قدیمی Advanced Voice شده و حالت پیشفرض است.
برای شروع، کافی است روی آیکون صوتی ChatGPT (که با نماد موج صوتی در سمت راست کادر متن مشخص شده) ضربه بزنید. اگر بار اول است، احتمالاً از شما اجازه دسترسی به میکروفون خواسته میشود. پس از ورود به حالت صوتی، یک گوی شناور و واکنشگرا روی صفحه ظاهر میشود و میتوانید مثل یک مکالمه معمولی شروع به صحبت کنید.
با زدن روی آیکون تنظیمات در گوشه سمت راست بالا، میتوانید سطح هوشمندی مدل صوتی را تغییر دهید. سه گزینه دارید:
- Instant (لحظهای): برای پاسخهای بسیار سریع.
- Medium (متوسط)
- High (بالا): برای تحلیلهای عمیقتر.
نکته: این قابلیت شخصیسازی برای نسخه رایگان (mini) در دسترس نیست و نیاز به اشتراک پولی دارد. همچنین، صدای ChatGPT حتی اگر از اپلیکیشن خارج شوید یا صفحه گوشی را قفل کنید، فعال باقی میماند.
اگر نیاز داشتید، میتوانید در تنظیمات (بخش Voice)، به مدلهای قدیمیتر برگردید یا صدا، زبان و تنظیمات پیشفرض را تغییر دهید.
نقاط قوت GPT-Live چیست؟
ChatGPT دیگر وسط حرف شما نمیپرد و دیگر لازم نیست با خجالت منتظر بمانید تا او حرفش تمام شود و بعد شما شروع کنید. در سوالات طولانی، حتی احساس میکردم که GPT-Live میتواند حدس بزند که قرار است در ادامه چه بگویید.
همچنین سرعت پاسخدهی این مدل، آن را به ابزاری عالی برای ترجمه همزمان تبدیل کرده است. در هر لحظه از گفتگو، میتوانید صفحه را به پایین بکشید تا متن (Transcript) تمام صحبتهای انجام شده را ببینید. علاوه بر این، اگر ChatGPT احساس کند پاسخی که به آن پرسیدهاید با تصویر بهتر منتقل میشود، در کنار پاسخ صوتی خود، یک ویجت تعاملی برای شما نمایش میدهد.
در حالت پیشفرض، سطح هوشمندی روی Instant تنظیم شده که اکثر سوالات روزمره را با اولویت سرعت بالا پاسخ میدهد، اما همچنان میتواند جستجوهای عمیق را به مدلهای قویتر بسپارد تا جریان گفتگو قطع نشود. اگر قصد دارید درباره موضوعات پیچیده بحث کنید، تغییر حالت به Medium یا High باعث میشود مدل یک یا دو ثانیه بیشتر فکر کند، اما این تأخیر کوچک اصلاً از روانی و طبیعی بودن گفتگو نمیکاهد.