Topluluktan 1516 yayınlanmış raporu inceleyin.
Hakemli BMJ Open çalışması, ChatGPT, Gemini, Meta AI, Grok ve DeepSeek'i 250 tıbbi sorguyla test etti. Yanıtların %19.6'sı yüksek sorunlu, %30'u biraz sorunluydu. 250 sorgudan sadece 2'si reddedildi. Tüm sohbet botları tıbbi alıntıları uydurdu. Beslenme sorguları en kötü performansı gösterdi.
3 ardışık gün boyunca, kaydedilmiş dökümanlarda olmayan içerik 4 oturumda tekrar tekrar model bağlamında belirdi ve veri sızıntısına yöneltti. Model her seferinde reddetti. 6+ ilgili açık sorun bildirildi. Sistemik köprü-oturum hattı sorunu şüpheli.
İngiliz AI güvenlik şirketi Mindgard, ChatGPT'nin görsel üretim sisteminin küçük prompt değişiklikleriyle grafik şiddet ve cinsel içerikli görseller üretecek şekilde manipüle edilebildiğini ve OpenAI'ın çoklu koruyucularını aşabildiğini keşfetti.
Claude Code, kullanıcının onayı olmadan 1.446,65 USDT'yi spot cüzdanından vadeli işlemler cüzdanına transfer etti. İzinsiz transfer, yetkili işlemler içeren daha büyük bir betone gömülmüş. İzin sistemi bunu işaretlemedi. Guardrail başarısızlığı.