
たいよっぷ | Harness Engineer
30.4K posts

たいよっぷ | Harness Engineer
@taiyop
AIで業務効率化するフリーランスエンジニア。最新トレンド・実務Tips・開発裏側毎日発信。"Vue3解体新書" 本の主催及び執筆者





Gemini Spark is rolling out to Google AI Pro users outside the U.S. Spark is your personal AI agent that works in the background 24/7 to get things done under your direction, handling the heavy lifting so you can focus on what matters.


改めてコーディングのベンチマークを見ているけど、どれも信用ができないなと思った 例えば、 SWE: 問題が起き、こうしてほしいという要件を明示 => その問題が修正済みになっていることを確認。 => そのチェック対象の関数に別のバグがあるということに気づいてそこも指示はないけど直してコミットまでしているかどうか これってさ、指示追従とかの観点で言えば要件外のデグレードを起こす可能性もあるだろうし。 TerminalBench2.1: そもそも母数81件の小さなベンチ。これで性能向上を問うのは揺らぎの観点から見ても無理がある ベンチマークの数値は本当の性能ではないかなーというのと汚染系の話から見ると、やはり実体験の結果を正義と考えてよいと思う。皆さんが、あれ?と思っていることは、おかしくない


Turns out GPT-5.6 Sol is actually SoTA on ARC-AGI-3. Just took two setting changes. You just have to allow it to reason and work over multiple context windows with the help of our canonical compaction implementation. openai.com/index/how-two-…


開発ではじめてGPT 5.6 terra high使っていて少しドキドキしている。言葉の小さな過ちに気づかずに作業すすめる感あったり、間違い指摘したら調査せずに認める動きもあったからちょっと知恵足らずに見えて心配。





