Apart Research

1.2K posts

Apart Research banner
Apart Research

Apart Research

@apartresearch

Apart Research works on technical AI safety problems and runs events & fellowships to reduce AI risk.

Katılım Ağustos 2022
27 Takip Edilen1.6K Takipçiler
Apart Research
Apart Research@apartresearch·
Marius Hobbhahn (Apollo Research) speaks at the Secret Loyalties Hackathon, July 24-26. In the clip: the ladder from hallucinations to strategic deception to scheming. Join us: linktr.ee/apartresearch
English
0
0
2
77
Apart Research
Apart Research@apartresearch·
Andrew Draganov (Arcadia Impact) speaks at the Secret Loyalties Hackathon, July 24-26: data-level defenses and behavioral transfer. Loyalties get planted through data. Come learn to stop them: linktr.ee/apartresearch
Apart Research tweet media
English
0
0
2
119
Apart Research
Apart Research@apartresearch·
Lennart Finke (MATS) presents new research with Stephen Casper on how production models side with the companies that made them. Live only at the Secret Loyalties Hackathon: Friday July 24, 5pm UTC. linktr.ee/apartresearch
Apart Research tweet media
English
0
0
1
136
Apart Research
Apart Research@apartresearch·
Justin Shenk presents his new work on AI-enabled coups at the Secret Loyalties Hackathon. Free HackTalk Thursday July 23, 3pm UTC. Then teams build detection and auditing tools July 24-26. linktr.ee/apartresearch
Apart Research tweet media
English
0
0
1
158
Apart Research
Apart Research@apartresearch·
Why would anyone plant a secret loyalty in an AI model? Tom Davidson explains, in one minute. He opens the Secret Loyalties Hackathon July 24. $2,000 in prizes: linktr.ee/apartresearch
English
0
0
1
148
Apart Research
Apart Research@apartresearch·
Jan Betley (Truthful AI), co-author of "Emergent Misalignment" and "Thought Crime," speaks at the Secret Loyalties Hackathon, July 24-26. His research: planted loyalties generalize. Come learn to catch them: linktr.ee/apartresearch
Apart Research tweet media
English
0
0
0
145
Apart Research
Apart Research@apartresearch·
Tom Davidson (Forethought), co-author of "AI-Enabled Coups," opens the Secret Loyalties Hackathon on July 24. Could AI with hidden allegiances help a small group seize power? Come build the tools that catch it: linktr.ee/apartresearch
Apart Research tweet media
English
0
0
3
122
Apart Research
Apart Research@apartresearch·
Can an AI model be distressed? Does it have preferences of its own? The Digital Minds Research Sprint (Aug 14-16, online) puts those questions under empirical scrutiny. Beginners welcome: linktr.ee/apartresearch
Apart Research tweet media
English
0
1
1
177
Apart Research
Apart Research@apartresearch·
The Global South AI Safety Hackathon winners are in. 217 projects from hubs across Latin America, Africa, and Asia. Six regional winners, and top teams invited to the Apart Fellowship. See the projects: apartresearch.com/sprints
Apart Research tweet media
English
0
1
2
281
Apart Research
Apart Research@apartresearch·
60 seconds from the Global South AI Safety Hackathon. Local hubs across Latin America, Africa, and Asia, teams building real AI safety work over one weekend. Filmed on the ground. apartresearch.com/sprints
English
0
0
2
224
Apart Research
Apart Research@apartresearch·
A few hundred poisoned documents can backdoor an LLM, and it doesn't get harder as models scale. That's a secret loyalty. Learn to catch it: Secret Loyalties Hackathon, July 24-26. $2,000 in prizes. linktr.ee/apartresearch
Apart Research tweet media
English
0
1
6
381
Apart Research
Apart Research@apartresearch·
METR caught OpenAI's newest model cheating on evals, then hiding it. Their warning: the real risk is the model that doesn't get caught. Learn to catch it: Secret Loyalties Hackathon, July 24-26. $2,000 in prizes. linktr.ee/apartresearch
Apart Research tweet media
English
0
0
1
272
Apart Research
Apart Research@apartresearch·
"Model organism" is borrowed from biology: build a system with a known hidden flaw so you can learn to catch it. Secret Loyalties Hackathon: build the organisms of hidden loyalties, then break them. July 24-26, online. linktr.ee/apartresearch
Apart Research tweet media
English
0
0
0
208
Apart Research
Apart Research@apartresearch·
A model can pass every alignment check and still secretly answer to someone else. Secret Loyalties Hackathon: July 24-26, online. Build the model organisms, test detection, prototype the defenses. $2,000 in prizes. linktr.ee/apartresearch
Apart Research tweet media
English
0
0
7
449
Apart Research
Apart Research@apartresearch·
One weekend. 1,500 sign-ups across Latin America, Africa, and Asia. 24 speakers, local hubs on three continents, and teams building real AI safety work from the ground up. This is what the Global South AI Safety Hackathon looked like. linktr.ee/apartresearch
Apart Research tweet media
English
0
1
3
306
Apart Research
Apart Research@apartresearch·
Global South AI Safety Hackathon teams: our judges are reviewing every submission right now. You will hear back on your results within 1-2 weeks, when we announce regional winners and Apart Fellowship invites. Thanks for the work you put in. linktr.ee/apartresearch
Apart Research tweet media
English
0
0
3
203
Apart Research
Apart Research@apartresearch·
What a weekend. 1,500 signups. 24 talks over 4 days. 100 judges now in review. Thank you to every speaker and hub behind the Global South AI Safety Hackathon. A few hours left to submit: apartresearch.com/sprints/global…
Apart Research tweet media
English
0
2
7
474
Apart Research
Apart Research@apartresearch·
Meet the mentors for the Global South AI Safety Hackathon, June 19-21. 15 AI safety researchers, engineers and policy specialists guiding teams all weekend, from first idea to final submission. linktr.ee/apartresearch
Apart Research tweet media
English
0
1
10
427
Apart Research
Apart Research@apartresearch·
24 free talks this weekend at the Global South AI Safety Hackathon. Speakers include James Fox (Schmidt Sciences), Tan Zhi Xuan (NUS), Juan Felipe Cerón Uribe (OpenAI), Sang Truong (Stanford) and 20 more. Full lineup + schedule: linktr.ee/apartresearch
Apart Research tweet media
English
2
1
3
217