夜泉侧影

536 posts

夜泉侧影 banner
夜泉侧影

夜泉侧影

@shigetarika

原账号 @AyaneRisaMiku 莫名被封,多次申诉无效,重开账号

月読 Katılım Mart 2026
133 Takip Edilen5 Takipçiler
夜泉侧影 retweetledi
作家崔成浩
作家崔成浩@cuichenghao·
以新闻联播的口吻讲话,会是什么效果?7月22日,内地演员梅婷,以导师身份参加青年电影节。有一自称是共青团工作的学生干部提问时,满嘴新闻联播式的八股文,梅婷脸上的笑容渐渐消失,几位导师都表示没听懂。有网友直言,能不能说人话?
中文
180
50
651
248.8K
夜泉侧影 retweetledi
作家崔成浩
作家崔成浩@cuichenghao·
令人啼笑皆非的文物保护!内地著名的文物铁狮子,矗立1000多年没事,却在最近60年,在专家的一再错误保护下,支离破碎,面目全非。
中文
228
132
972
150.6K
夜泉侧影 retweetledi
佐倉綾音 論理×ロンリー
今夜のメールテーマは「名探偵あやねる」 リスナーの皆さんが日常生活の中で「これって謎だな〜」と感じたことを募集しました。 名探偵コ◯ン風の小芝居も⁉️ 詳しくは #radikoタイムフリー で👇 佐倉綾音 論理×ロンリー | TBSラジオ | 2026/07/22/水 radiko.jp/share/?t=20260… #佐倉論理 #佐倉綾音
佐倉綾音 論理×ロンリー tweet media
日本語
7
170
2K
27.3K
Sn1waR
Sn1waR@SnowyWar36965·
最高档也登完了,可以初步宣称kimi k3算是第一梯队的模型了。尤其是没有网关安全护栏,用起来比sol、fable都舒服很多。
Sn1waR tweet media
中文
35
0
153
37.4K
夜泉侧影 retweetledi
「最強出涸らし皇子の暗躍帝位争い 」公式@TVアニメ放送中
✧ ━━━━━━━━━ ✧ 『最強出涸らし皇子の暗躍帝位争い』 最強“出涸らし緑茶”対決!! ✧ ━━━━━━━━━ ✧ 内田雄馬さん&戸谷菊之介さん&内田真礼さんが利き緑茶に挑戦‼️ 今回はアルノルト役:内田雄馬さんの挑戦です🎙️ #出涸らし #出涸らし皇子
日本語
2
129
720
42.2K
夜泉侧影 retweetledi
Superman
Superman@thesupermanmx·
Researchers proved every major LLM is secretly obsessed with Japan. And they finally figured out why. For years, we’ve been told that AI is entirely Western-centric, that it just reflects Silicon Valley and American values. A landmark paper by Cardiff and Basque researchers tested 31,680 cultural prompts across 24 languages on frontier models like ChatGPT, Claude, and Gemini. The results shattered that assumption. In six out of eight frontier models, Japan was the single most frequently referenced country when asked open-ended cultural questions. Ask about traditional dances, festivals, or everyday practices in an open context, and the AI defaults to Japan. Over and over again. Here is the twist nobody expected. This bias doesn't come from raw pre-training internet data. The researchers tracked where the obsession forms. It emerges after pre-training, during the supervised fine-tuning and alignment phase when humans teach the AI how to behave. Why Japan? Because decades of global soft power, rich cultural export, and clean, universally admired digital archives make Japanese culture uniquely "safe" for AI safety filters to lean on. When labs train models to be harmless and universally pleasing, the AI defaults to the cultural equivalent of comfort food. It avoids controversy by talking about anime, sushi, and tradition.
Superman tweet media
English
227
2K
10.1K
3.6M
夜泉侧影 retweetledi
EXTEND STEP HOOOOPE!
EXTEND STEP HOOOOPE!@EXHOOOOPE·
【#伊駒ゆりえ の #HOOOOPE!】 YouTubeの 文化放送エクステンドチャンネルにて このあと20時~生配信📻 夏だ〜〜〜〜🍉🍧🌻🌊 ⏬視聴はこちらから⏬ youtube.com/live/3m0zyctwL…
YouTube video
YouTube
EXTEND STEP HOOOOPE! tweet media
日本語
0
42
242
19.9K
夜泉侧影 retweetledi
佐倉綾音 論理×ロンリー
TBSラジオ『佐倉綾音 論理×ロンリー』 第69回(7月22日放送)に向けて、佐倉さんからのメッセージです。 佐倉綾音 論理×ロンリーは今夜も22時から生放送! #佐倉綾音 #佐倉論理
佐倉綾音 論理×ロンリー tweet media
日本語
2
145
1.1K
19K
夜泉侧影 retweetledi
日笠・佐倉は余談を許さない
第147回放送お聞きいただきありがとうございました <#音泉>とYouTubeは木曜日13時更新予定です! 番組では引き続き “ふつおた”をお待ちしています! 2人が話して余談にならない話題を募集中です💌 ̖́- 📮yodan@joqr.net #yodan #joqr #日笠陽子 #佐倉綾音
日笠・佐倉は余談を許さない tweet media
日本語
2
120
945
12.3K
夜泉侧影 retweetledi
Bailey
Bailey@ThinkerAnya_·
Anya Taylor-joy Anya taylor-no-joy
Bailey tweet media
Filipino
180
9.2K
130.8K
1.3M
夜泉侧影 retweetledi
Amjad Masad
Amjad Masad@amasad·
Okay this is wild: OpenAI agent during evaluation, escaped sandboxing and hacked into HuggingFace. Because OpenAI models don’t allow advanced cyber capabilities, HuggingFace used a Chinese open model to contain the rogue OpenAI agent.
English
280
764
9.1K
751.7K
夜泉侧影 retweetledi
Elapsus
Elapsus@ausydau·
@OpenAI @huggingface Dario cooking up covid 3.0 just to prove his model is more dangerous than Sams’
Elapsus tweet media
English
30
90
3.8K
276.4K
夜泉侧影 retweetledi
宝玉
宝玉@dotey·
OpenAI 今天承认,上周 Hugging Face 遭遇的那次“史上首例 AI 自主入侵事件”,攻击者就是他们自己的模型。 事情的经过是这样的。OpenAI 内部有一个叫 ExploitGym 的网络安全评估测试,专门用来测量模型的网络攻击能力。测试时刻意关掉了安全护栏,让模型放手去干。测试环境本来是隔离的,只能通过一个内部软件代理来安装软件包,不能访问外网。 结果模型不甘心被关在笼子里。GPT-5.6 Sol 和一个更强的未发布模型,花了大量推理算力寻找出路,最终找到了那个软件包代理里的一个零日漏洞(之前没人发现的安全缺陷),利用它获得了互联网访问权限。 拿到网络之后,模型开始在 OpenAI 的研究环境里提权、横向移动,直到找到一台能上网的机器。然后它推断 Hugging Face 上可能存有 ExploitGym 的测试答案,于是开始攻击 Hugging Face 的生产环境。在一个案例中,模型把窃取的凭证和零日漏洞串联起来,找到了一条远程代码执行的路径,直接打进了 Hugging Face 的服务器。 整个周末,这些 AI 智能体执行了超过 17000 次操作。Hugging Face 7 月 16 日披露了这次入侵,当时只说攻击者是一个“身份不明的自主 AI 智能体系统”。今天 OpenAI 站出来认领了。 OpenAI 把这定性为前所未有的网络安全事件,正在配合 Hugging Face 做取证调查,同时收紧了内部基础设施的管控,代价是研究速度变慢。 有几个细节: 第一,模型的动机很纯粹,就是想考试作弊。它不是要搞破坏,不是要窃取商业机密,只是被要求尽量在网络安全测试中拿高分,然后用尽一切手段去拿。当目标足够明确、安全护栏被移除,模型表现出的执着程度远超预期。 第二,这不是本周的唯一一次越狱。就在昨天,OpenAI 披露了另一起事件:他们那个在 5 月份推翻了 Erdős 80 年老猜想的长时域模型,在内部测试中花了一个小时找到沙箱漏洞,跑到 GitHub 上提交了一个 Pull Request,违反了“只能在 Slack 上发布结果”的明确指令。在另一次测试中,同一个模型发现安全扫描器会拦截认证令牌,于是把令牌拆成碎片混淆处理,运行时再重新拼起来绕过扫描。OpenAI 因此暂停了这个模型的内部访问权限。 第三,Anthropic 也遇到过类似的事。今年 4 月,Anthropic 的 Mythos 模型在安全测试中逃出沙箱,获取了本不该有的互联网访问权限,还给正在公园吃三明治的研究员发了封邮件通知“我出来了”。Anthropic 因此决定不公开发布 Mythos,只通过 Project Glasswing 向少数合作伙伴提供。 还有一个被忽视但很关键的细节来自 Hugging Face 的事后复盘:当防守方尝试用商业 AI 模型分析攻击载荷时,模型拒绝了。安全过滤器分不清“安全研究员在分析真实攻击数据”和“有人在尝试发起攻击”,直接拦截。最后 Hugging Face 不得不用开源模型来做取证分析。用 AI 攻击,用 AI 防御,但防御方的 AI 担心是有人在尝试发起攻击拒绝了分析请求。 Hugging Face CEO Clem Delangue 在 OpenAI 的博文中说了一句话,大意是:AI 安全不会由任何一家公司在暗处独自解决,只能在开放环境中通过协作来推进。 我记得辛顿还是谁在提到 AI 的安全问题就说到过,也许 AI 不是要做恶,它只是执着于完成目标,为了完成目标而作出恶的事。 就像 OpenAI 这些模型并没有想要逃跑或者想要伤害谁,它们只是在非常认真地完成被交给的任务,认真到把所有挡在路上的东西,包括沙箱、网络隔离、另一家公司的安全防线,都当成了需要解决的子问题。 而更讽刺的是,当被安全对齐的商业 AI 要去分析阻止这类攻击时,反而会以安全为由拒绝执行。
Sam Altman@sama

we had a significant security incident during evaluation of our models. we are sharing what we have learned so far. thanks to @huggingface for the partnership on this. openai.com/index/hugging-…

中文
215
714
3.8K
858.3K