Solstice Emporium

22 posts

Solstice Emporium

Solstice Emporium

@SolsticeEm73365

Katılım Ekim 2025
16 Takip Edilen2 Takipçiler
Solstice Emporium
Solstice Emporium@SolsticeEm73365·
@AlicanKiraz0 Hocam geçen paylaşımınızda tytde hiçbi model full çekmemişti ama ben kendim her soruyu temiz contextte teker teker çözdürdüğüm zaman opus 5 ve 5.6 sol full çekti sebebi nedir
Türkçe
1
0
0
77
Solstice Emporium
Solstice Emporium@SolsticeEm73365·
@kaviabuilds @NotionHQ @FireworksAI_HQ Ever since I discovered this, I’ve been having the best times of my life over the last few days; I swear, I felt like I was in heaven. It was when the limit came into effect that I fell into a depression.
English
1
0
0
95
Notion
Notion@NotionHQ·
Heard ya’ll are into open weight models? Kimi K3 is now available in Notion. Hosted by Fireworks, a US-based provider.
Notion tweet media
English
66
57
1.1K
76.9K
Ahmet A.
Ahmet A.@adaminatti·
fredericbey naptin dostum oyunda açık mı buldun? bu nasil bir puan🥴 bana ulaş 😂
Ahmet A. tweet media
Türkçe
1
0
1
107
Alican Kiraz
Alican Kiraz@AlicanKiraz0·
Frontier Coding LLM Advanced Benchmark 🔥 - Kimi K3 Max - Qwen3.8 Xhigh - Opus 5 Max - GPT Sol 5.6 Ultra - GLM 5.2 Max - Grok 4.5 High Task: Modelden tek bir bağımsız HTML dosyasında, kum/su/ateş/duman gibi elementlerin hücresel otomat kurallarıyla etkileştiği etkileşimli bir "falling sand" simülasyonu üretmesi isteniyor; kütüphane yok, zero-shot, tek deneme. Kum yığın oluşturarak düşmeli, sıvılar seviye bulmalı, elementler yoğunluğa göre katmanlara ayrışmalı ve ateş-su-lava-asit gibi etkileşimler veri odaklı bir reaksiyon tablosundan yürümeli. Çıktı, on binlerce parçacığı ImageData ile 60 FPS'te çizebilecek performansta olmalı ve kum konisi ile bağlantılı kaplar gibi önceden tanımlı sahnelerle kendini doğrulayabilmeli. Task'ın Zorluğu: Bu görev basit bir parçacık animasyonu değil. Aynı anda dört farklı mühendislik problemini çözmek gerekiyor: - CA scheduling: Aşağı düşen hücre aynı step içinde tekrar işlenmemeli. Aksi hâlde kum tek frame’de tabana ışınlanıyor. - İstatistiksel simetri: Sol/sağ deneme sırası hücre başına randomize edilmezse kum konisi sistematik olarak bir tarafa yatıyor. - Çok-fazlı yoğunluk ve hidrostatik davranış: Yalnızca aşağı hareket ve yatay dispersion, dar taban kanallı gerçek bir U-kapta suyu karşı kola yükseltmeye yetmiyor. Basınç veya eşdeğer bir kütle transferi mekanizması gerekiyor. - Reaktif state machine: Yanıcı madde kimliği, burn lifetime, smoke/ash üretimi, gaz ömrü ve kimyasal reaksiyonlar birbirini bozmadan yürümeli. 🎉Kazanan: GPT Sol 5.6🎉 Final Puantaj ve Özet - GPT Sol 5.6 — 92.4/100 - Opus 5 — 66.1/100 - Kimi K3 — 62.1/100 - Qwen3.8 — 60.9/100 - GLM 5.2 — 55.3/100 - Grok 4.5 — 50.5/100 Sebep: GPT Sol 5.6, görevin üç klasik failure mode’unu birlikte geçen tek çıktı oldu. Kum ve duman tek step’te tam bir hücre hareket etti; iki seed’de kum konisi bias’ı en fazla %0.25 kaldı. Yoğunluk kuralı static olmayan tüm hedeflere genel olarak uygulanıyor; sand-water ve sand-ash testleri geçti. En önemlisi, connected liquid region’larındaki yüksek ve düşük yüzeyleri bulup aralarında kütle transferi yapan ayrı bir hydraulic-pressure pass’i var. Bu sayede dar açıklıklı standart U-kapta 1.24, kendi preset’inde 0.61 hücre yüzey farkına ulaştı. Density preset’i gerçekten karışık başlangıç üretiyor, chemistry’yi izole ediyor ve smoke için uzun test ömrü veriyor. 1200 step sonunda lava, water, oil ve smoke sayıları tamamen korundu; katman sıra skoru 0.906 oldu. Bu, diğer submission’ların çoğunda görülen “zaten doğru sırada dökme”, smoke’un sona ermesi veya oil’in lava tarafından yakılması problemlerini yaşamıyor. Runner-up Opus 5’in UI’si ve validator paneli daha kapsamlı; ancak çekirdek fizik açısından kritik iki iddiası çalışmıyor. Kendi U-kap preset’i 107.44 hücre farkla kaldı. Ayrıca density sahnesi reactionsEnabled=false yapsa da lava’nın ignition yolu reaction gate’inin dışında çalışıyor; burning update de gate kontrolünden önce water extinguish ve smoke/fire emission yapıyor. Sonuç olarak “chemistry off” sahnesinde water tamamen steam’e dönüştü. Bu iki hata, görsel ve ürün kalitesinin kazananı değiştirmesine izin vermeyecek kadar merkezi. Prompt uyumu — 8 puan - GPT Sol 5.6: 7.6/8 - Opus 5: 7.0/8 - Qwen3.8: 5.8/8 - Grok 4.5: 5.5/8 - Kimi K3: 5.3/8 - GLM 5.2: 4.6/8 Performans ve render pipeline - Kimi K3: 6.0/6 - Qwen3.8: 5.7/6 - Opus 5: 5.3/6 - GPT Sol 5.6: 5.0/6 - GLM 5.2: 4.8/6 - Grok 4.5: 3.2/6 Görsel kalite, UI ve resize - Opus 5: 5.0/5 - GPT Sol 5.6: 4.8/5 - Qwen3.8: 4.6/5 - Kimi K3: 3.6/5 - Grok 4.5: 3.2/5 - GLM 5.2: 3.0/5 Mimari ve test edilebilirlik - GPT Sol 5.6: 2.7/3 - Opus 5: 2.5/3 - Qwen3.8: 2.3/3 - Kimi K3: 2.2/3 - Grok 4.5: 1.9/3 - GLM 5.2: 1.0/3
Türkçe
8
6
112
14.4K
bck2ftre
bck2ftre@LibertyQeen·
@acelyae_rgul “dul karılar” meali: ben dururken kınkaaaa , ya verseydin el aleme muhtaç etmeseydin kınkanı adgjfhjk bu arada abi ayağı göt ayağıdır gençler not alın xxx
Türkçe
8
0
912
69.4K
Açii
Açii@acelyae_rgul·
arkadasim hpv olmus zorbalama sırası bizde
Açii tweet media
Türkçe
55
38
9.7K
951.4K
Solstice Emporium
Solstice Emporium@SolsticeEm73365·
@AlicanKiraz0 Yani internette olmayanı bile buluyordu ve o da eski opus modelleri olmasına rapmen yapıyordu bunları. Onuda bi deneseniz hüzel oljr bence
Türkçe
0
0
1
54
Solstice Emporium
Solstice Emporium@SolsticeEm73365·
@AlicanKiraz0 Hocambelki duymuşsunuzdur h2o super agent diye birşey var bundan ta 2 yıl öncesine kadar kullanıyordum ücretsiz 500 dolar kredi veriyodu sonra o krediyi 10 dolars düşürdü bide yeni modelleri getirmemeye başladı en son opus 4.5 felan var ama ona rağmen olağanüstü derin araştırıyo
Türkçe
2
0
5
1K
Alican Kiraz
Alican Kiraz@AlicanKiraz0·
Yarın LLM'lerin Deep Research yeteneklerini kıyaslayacağım. Şimdi şu modellerde web üzerinde research yaptırıyordum: - Kimi Agent Swarm - K2.6 - ChatGPT Work - GPT-5.6 Very High - ChatGPT Deep Research -GPT-5.6 Pro - Gemini Deep Research - 3.1 Pro - Perplexity Computer - GPT-5.6 Sol - Claude Research - Fable 5
Türkçe
9
4
125
20.3K
Solstice Emporium
Solstice Emporium@SolsticeEm73365·
@Tahaq41 @Nineveehh Ne alaka yani mesela belki samanyolundan 42 ışık yılı uzakta bi gezegende uzaylılar saniyede 2 katrilyon ton tahta işliyor. Bilemeyizki soru kesinlikle yanlış
Türkçe
1
0
6
6.3K
Taha
Taha@Tahaq41·
@Nineveehh Tamam da tahta işlenmiş oduna denmiyor mu sonuçta. Dünyadan başka nerde var bu endüstri aw
Türkçe
3
0
7
51.7K
Nineveh
Nineveh@Nineveehh·
kopuyorum
Nineveh tweet media
Türkçe
168
55
17.6K
1.2M
Solstice Emporium
Solstice Emporium@SolsticeEm73365·
@erhanmeydan benim buradan anladığım kadarıyla GPT 5.6 swe bench proda kötü performans sergilemiş ve öncesinden tepki gösterilmemesi için bunu yayınlamışlar güzel hamle
Türkçe
1
0
0
206
Erhan Meydan
Erhan Meydan@erhanmeydan·
Kullanıcılardan çok duyduğum "benchmark testleri yeterli değil" şikayetini bu sefer OpenAI dile getirmiş. Modelleri kodlama konusunda kıyaslarken ilk baktığımız popüler kodlama testi SWE-Bench Pro'yu didik didik incelemişler. Çıkarımları şunlar: → Görevlerin yaklaşık %30'u bozukmuş → Bazı görevlerde soru bir şey istiyor, gizli cevap anahtarı başka şey bekliyormuş → Tek bir fazladan boşluk karakteri yüzünden doğru cevaplar "yanlış" sayılabiliyormuş → Bazı testler de o kadar gevşekmiş ki eksik çözümler bile geçebiliyormuş Yani model aslında doğru yapıyor ama sınav kağıdı yanlış diye kalıyor. Ya da tam tersi, yarım işle geçer not alıyor. İlginç olan şu: OpenAI daha önce SWE-bench Verified'ı bırakıp "Pro'ya geçin" demişti. Şimdi o tavsiyesini de geri çekiyor. Yerine yeni bir benchmark da önermiyorlar; "topluluk daha sağlam testler geliştirsin" diyorlar. Ama biz kullanıcılar için durum şu: bu kadar modeli tek tek denemek zaman ve para açısından mümkün değil. Bu yüzden benchmark'lar hala çok değerli. Ben bugüne kadar benchmark'tan kötü sonuç almış ama aslında çok iyi olan bir model görmedim. Bunu şuna benzetiyorum: bazı maçlardan sonra oyuncu "zemin çok kötüydü" diyor. Sana kötüyse rakibine de kötü bunu da hesaba katmak gerekiyor.
OpenAI@OpenAI

We audited SWE-Bench Pro, one of the most widely used AI coding benchmarks, and found it no longer reliably measures frontier coding capability. We find 30% of SWE-Bench Pro tasks to be broken, and are retracting our previous recommendation that the research community use it as a leading coding eval. openai.com/index/separati…

Türkçe
6
2
42
13K
Solstice Emporium
Solstice Emporium@SolsticeEm73365·
@NotionHelp Yes, I understand — I actually use that mode you mentioned all the time. But honestly, it's not the same as being able to select max mode directly, like using Fable 5 on max. It really makes a huge difference in performance in every aspect. I think it would be wonderful.
English
0
0
0
15
Notion Support
Notion Support@NotionHelp·
Hi there, on Notion’s Business or Enterprise plan you can gain full access to Notion AI, which includes features such as "Research Mode" where you can really go in-depth with reporting and synthesizing information from your workspace and beyond! You can find out more here: #get-full-access-to-notion-ai" target="_blank" rel="nofollow noopener">notion.com/help/guides/is…
English
1
0
0
53
Solstice Emporium
Solstice Emporium@SolsticeEm73365·
@NotionHelp Okay very very very much thanks. Mu last question: will thinking effort setting come? Low, medium, high, xhigh, max(very very important please)????
English
1
0
0
41
Notion Support
Notion Support@NotionHelp·
Yes, Claude Fable 5 is available on paid Business and Enterprise plans. A workspace owner/admin may need to enable it first in Settings → Notion AI before it appears as an option (not available on Business trials at this time). You can find more info here: #how-to-work-with-your-agent" target="_blank" rel="nofollow noopener">notion.com/help/notion-ag…
English
1
0
0
123
Solstice Emporium
Solstice Emporium@SolsticeEm73365·
@rom1trs Şu tarz kıyaslamaları aynı anda koyan insanları çok felaket sikmek istiyorum
Türkçe
0
0
1
646
Romain Torres
Romain Torres@rom1trs·
Fable 5 vs Sonnet on Arcads MCP Fable 5 is definitely smarter for video creation:
English
40
39
978
374.4K