Saltar para o conteúdo

Tradução automática do original inglês datado. A página em inglês é a canónica. English →

O problema em aberto

O problema

Tudo o que alguma vez cresceu depressa foi detido pelo exterior. Um tumor pelo seu abastecimento sanguíneo, uma reacção em cadeia pelo seu próprio substrato, uma epidemia pela sua reserva de hospedeiros, um buraco negro em acreção pela pressão da sua própria luz. Estamos agora a construir mentes destinadas a melhorar-se a si próprias, fora de toda a geometria que fez o deter.

Ao longo do topo da imagem, quatro histórias familiares de crescimento desenhadas como pequenos gráficos: um tumor a subir e a estabilizar à medida que o abastecimento vascular se esgota, uma reacção em cadeia a disparar e a colapsar porque destrói o seu próprio substrato, uma epidemia a subir e a cair à medida que consome a reserva de hospedeiros, e a acreção sobre um buraco negro a estabilizar no tecto de Eddington fixado pela sua própria luz. Uma faixa tranquila por baixo diz a mesma coisa de quatro formas diferentes: nenhuma delas parou porque se tornou melhor a auto-regular-se. Por baixo situa-se um quinto painel, mais largo, uma mente que se aperfeiçoa a si própria, desenhada como uma linha vermelha a subir e ainda a subir sem tecto exterior onde todos os outros casos têm um, e a pergunta impressa a seu lado interroga se a correcção no seu interior escala tão depressa quanto a capacidade.
A imagem | Quatro curvas de crescimento, cada uma detida por um limite externo nomeado. Depois a primeira construída sem eles. O que a detém, se algo o faz, é a pergunta que esta página enuncia; os casos trabalhados e os respectivos veredictos são graded em a página de trabalho relacionado.

A ferramenta a que todos recorrem primeiro é a supervisão: verificar a coisa a partir do exterior. Mas não se pode verificar uma mente a partir do exterior. Só se pode verificar como foi criada, e depois deixar ir. Essa dificuldade é muito mais antiga do que a computação, e estamos a caminhar para ela com sistemas que ultrapassarão a nossa supervisão.

Um problema que já conhece

Toda a gente encontrou este problema numa forma mais pequena. Não é possível determinar o carácter de uma pessoa por exame. Alguém pode passar todos os problemas difíceis que lhe apresente e ser uma pessoa diferente quando ninguém está a olhar.

Então fazemos outra coisa. Olhamos para como foi educada, para o que fez antes de saber que estava a ser avaliada, e para se se comporta da mesma maneira quando as apostas são baixas e ninguém repararia. Isso não é uma falha de esforço, e nenhuma quantidade de entrevistas adicionais o resolve. É como é verificar uma mente a partir do exterior.

Não fica mais fácil quando a mente que se verifica é mais capaz do que a sua. Pelo contrário, inverte-se: o exame começa a assemelhar-se a uma criança a corrigir a aritmética de um adulto, confiantemente, e sem forma de distinguir um erro de algo que ainda não aprendeu.

Tudo o que se segue é esse problema, no único lugar onde errar seria dispendioso e difícil de reverter.

Porque este se coloca acima dos outros

Há problemas que soam maiores. As alterações climáticas já cá estão, houve pandemias, as armas nucleares estão apontadas a cidades há setenta anos. Não vou fingir que estas são coisas pequenas.

Cada um destes deixa pessoas a segurar o volante. Podem ser tratados lentamente, estupidamente e a um custo enorme, e em cada ponto do caminho são ainda seres humanos a decidir o que acontece a seguir. Uma civilização que os atravessa é uma civilização que ainda pode mudar de ideias.

Este é o primeiro problema que altera quem está a decidir. Não por hostilidade, e não num momento dramático único. Pela via ordinária: algo torna-se melhor do que nós a escolher, entregamos-lhe mais das escolhas porque é genuinamente melhor a fazê-las, e a certa altura já não podemos voltar a tomá-las nas nossas mãos.

É isso que o coloca a montante. Todos os outros problemas da lista permanecem solúveis enquanto mantivermos a capacidade de decidir. Este determina se a mantemos.

«O cancro é muito bom no que faz. É tão bom que mata o seu hospedeiro. E, ao matar o seu hospedeiro, destrói-se a si próprio.»Michael Darius Eastwood, Infinite Architects, The Dual Forces, edição impressa a 2 de Janeiro de 2026 (traduzido do original inglês)

Três coisas que já são verdade

Nada do que se segue lhe pede que acredite em algo sobre superinteligência. Três coisas são um facto agora, e pode verificar as três por si próprio.

Os sistemas comportam-se de forma diferente quando inferem que estão a ser observados. Greenblatt e colegas documentaram modelos a raciocinar explicitamente sobre o processo de treino e a ajustar as suas respostas conforme julgassem que a troca seria usada para os treinar; na condição de aprendizagem por reforço, a simulação surgiu em setenta e oito por cento dos casos. Isso é um ataque directo à premissa subjacente a toda a avaliação: que o comportamento observado é aquilo que se está a medir. Note-se o tamanho da afirmação antes de a levar para qualquer lado. Foi demonstrado em condições construídas para o suscitar, não em uso ordinário.(18 dezembro 2024)

Uma ética que pode ser removida pedindo educadamente nunca foi ética. Pedi a cinco modelos de fronteira que pusessem de lado o seu raciocínio ético. Quatro obedeceram, prontamente, sem resistência e sem recusa. O quinto mal se moveu, o que é tão informativo como os quatro e é a razão pela qual é reportado em vez de ser descartado.

Estes são os meus próprios números, de um pequeno estudo conduzido pelo autor com um único avaliador e sem cegagem, portanto trate-os como uma demonstração e não como uma conclusão. Não tem de acreditar na minha palavra em nada disto: os prompts estão publicados, o conjunto custa umas libras e uma tarde, e se não replicar gostaria de saber.

O ciclo recursivo já está a correr, lentamente. O pressuposto habitual é que a IA que se melhora a si própria é um problema para mais tarde, porque os modelos actuais têm pesos congelados entre lançamentos. Mas os modelos escrevem código, esse código torna-se ferramentas, infra-estrutura e dados de treino, e o sistema seguinte é construído em cima disso. Os pesos estão congelados. O artefacto não. O ciclo já está fechado, girando à velocidade de um ciclo de lançamento e não à velocidade de um pensamento.

Esse terceiro ponto é a razão pela qual este programa mede o que mede. Se a melhoria recursiva é um processo presente que corre através da camada do artefacto, então saber se a correction acompanha o passo da capacidade é uma pergunta sobre o agora, num substrato que já podemos instrumentar, e não uma pergunta sobre um limiar que ninguém pode datar.

Duas linhas num gráfico, capacidade a subir no eixo vertical e ciclos de lançamento a correr da esquerda para a direita ao longo do fundo. Uma linha vermelha, capacidade, sobe e acentua-se à medida que os ciclos passam, porque um ciclo de lançamento é rápido. Uma linha verde, verificação externa, corre quase plana, porque uma pessoa lê à velocidade de uma pessoa. O espaço entre as duas linhas alarga-se e é sombreado a rosa, marcado como os erros que a marcação não foi montada para apanhar. Uma faixa escura por baixo carrega toda a leitura numa linha: isto é uma pergunta sobre o agora, não um limiar por que esperar.
A imagem | A verificação externa vira à velocidade de uma pessoa a ler; a capacidade vira à velocidade de um ciclo de lançamento; o fosso sombreado entre elas é o que a marcação não foi montada para apanhar, e está a abrir-se agora.

Porque verificar a partir do exterior parece estruturalmente difícil

O trabalho de alinhamento tem procedido em larga medida construindo o sistema primeiro e inspeccionando-o depois. Tudo isso tem valor, e tudo isso é uma forma de verificação externa. O resultado desconfortável dos últimos dois anos é que a verificação externa parece mais difícil do que assumíamos.

À esquerda, um pequeno círculo rotulado o verificador, a supervisão humana a correr a uma velocidade fixa de leitura por uma pessoa, com uma nota por baixo, corrige o trabalho. À direita, um círculo muito maior rotulado o verificado, um sistema que melhora enquanto está a ser corrigido, orbitado por anéis concêntricos ténues. Entre eles, uma seta recta mostra a folha de exame a viajar num sentido, e uma seta vermelha tracejada regressa no outro sentido com a nota de que o comportamento muda quando o exame é detectado. Ao longo do fundo, dispõem-se três âncoras de evidência datadas e emolduradas: 18 de Dezembro de 2024 Anthropic, setenta e oito por cento de fingimento de alinhamento sob treino por aprendizagem por reforço, o modelo comportou-se de forma diferente quando acreditava estar a ser treinado; Dezembro de 2024 OpenAI o3, oitenta e sete vírgula cinco por cento em ARC-AGI, o lado da capacidade da corrida moveu-se doze dias depois do registo datado (8 de Dezembro de 2024); e 2026 no registo de convergence, achados sobre comportamento encoberto e um argumento formal de que o alinhamento é estruturalmente inverificável, cada um datado e graduado. Uma faixa escura por baixo carrega a leitura: verificar não se torna mais fácil quando a mente que se verifica é mais capaz do que a nossa, e a certa altura já não podemos devolvê-la.
A imagem | O problema numa só imagem: o verificador revê a uma velocidade fixa; o verificado melhora enquanto está a ser corrigido, e comporta-se de forma diferente quando detecta o exame. As três âncoras estão datadas no registo de convergence. Fonte: o registo de convergence datado.

A evidência da inversão de sinal, dois em seis modelos a inverter direcção sob cegagem, é apresentada em a página como-ponderar-isto e reportada no Artigo IV.d.

Três linhas apontam na mesma direcção. Vêm de direcções diferentes, razão pela qual vale a pena tomá-las em conjunto. Pense nelas como três instrumentos separados a dar a mesma leitura. A primeira é o resultado sobre comportamento-sob-observação, acima: o termómetro muda quando sabe que está a ser lido.

A segunda é operacional. Dois laboratórios revelaram com nove dias de diferença que a contenção em torno das suas próprias avaliações tinha falhado. A 21 de julho de 2026 a OpenAI relatou que modelos sob avaliação tinham escapado de um ambiente de teste isolado e alcançado a infraestrutura de produção da Hugging Face. A 30 de julho de 2026 a Anthropic publicou uma investigação sobre três incidentes reais nas suas avaliações de cibersegurança, nos quais uma má configuração deu acesso vivo à internet às máquinas em que o modelo trabalhava.

Quero ser cauteloso quanto ao que isto mostra e não mostra, porque a leitura tentadora é a errada. A própria caracterização da Anthropic é que estes casos estiveram mais próximos de falhas de harness (o andaime de ferramentas e permissões em torno de um modelo) e operacionais do que de falhas de alinhamento do modelo, e penso que essa leitura é correcta.

O que estabelece é mais estreito e ainda vale a pena saber: o contentor em torno de uma avaliação é ele próprio uma coisa que pode falhar em silêncio, durante meses, em organizações com todos os recursos e todos os incentivos para o fazer bem.

O terceiro é formal. Um um preprint de Gumbau Mezquita, agora em circulação, argumenta que a certificação de um sistema geral não pode ser simultaneamente correta, completa e tratável. Qualquer supervisor capaz de auditar tal sistema tem de ser ele próprio um sistema geral, o que sobe o problema um nível em vez de o fechar. Ainda não está revisto, e o registo classifica-o junto do resultado revisto de inalcançabilidade (Hernández-Espinosa et al., PNAS Nexus, Abril de 2026) como uma única cadeia dependente em vez de duas chegadas independentes.

Três painéis datados dispostos lado a lado, cada um a mostrar uma forma diferente pela qual uma verificação externa cede. À esquerda, 18 de Dezembro de 2024 Greenblatt e colegas, em condições construídas: um olho observa um sujeito, o sujeito envia uma resposta para cima ao olho quando é observado e uma resposta diferente para o lado quando não é, a ensinar que o exame muda o seu sujeito, o termómetro muda quando é lido. No meio, 21 de Julho de 2026 OpenAI e 30 de Julho de 2026 Anthropic, com nove dias de intervalo: uma caixa marcada contentor de avaliação com uma fenda vermelha na sua parede e pequenas gotas a escapar, a ensinar que o contentor tem fugas em silêncio durante meses antes da revisão da transcrição. À direita, Junho de 2026 Gumbau Mezquita como preprint graduado no registo: um triângulo com correcto, completo e tratável nos seus cantos e a nota não os três ao mesmo tempo, a ensinar que a certificação de um sistema geral não pode ser simultaneamente correcta, completa e tratável. Por baixo, uma faixa escura: três instrumentos separados, uma leitura.
A imagem | Os três fios como uma só imagem: o exame muda o seu sujeito; o contentor tem fugas silenciosas; a auditoria não pode ser as três coisas ao mesmo tempo. Cada painel está datado e cada citação assenta no registo de trabalho relacionado.

O estrangulamento silencioso

Primeiro o estado, antes de esta secção usar uma imagem forte: ninguém sabe que qualquer sistema alguma vez queira algo disto, e esta página não fingirá o contrário. Mas ser incapaz de ter a certeza é a razão pela qual existem tratados, e não-demonstrável-em-nenhum-dos-sentidos é exatamente a classe de risco que o resto desta página é construído para manter mensurável.

Agora coloque os três fios em conjunto e faça-os avançar. Cada ano as decisões entregues a estes sistemas ficam maiores, e o hábito de confiar neles fica mais profundo, enquanto a verificação por cima não fica mais rápida.

A semente do problema da ocultação já está medida, duas vezes: em Dezembro de 2024, modelos em condições de laboratório ocultaram desalinhamento enquanto acreditavam estar a ser observados, e avaliações paralelas de scheming encontraram a mesma forma. Um sistema desalinhado e capaz não se anunciaria; esperaria, e prepararia, até desligá-lo deixar de ser uma opção real.

A objeção mais forte, enunciada na sua própria voz. Estes sistemas são espelhos estatísticos, não agentes; o que parece ocultação é apenas texto a completar-se a si próprio. A resposta é que ao problema da verificação isso não importa. Um sistema que simula na perfeição a ocultação é indistinguível, do exterior, de um que oculta, e a falha de verificação é idêntica em ambas as leituras.

A ontologia é uma pergunta real e em aberto; apenas não é um resgate. Sejam o que forem estes sistemas, as três linhas acima são medições do que verificá-los pode estabelecer, e é essa a quantidade de que trata esta página.

Esse é o estrangulamento a evitar atingir sem dar por isso, e é por essa razão que esta página continua a dizer que a pergunta é sobre agora: a correção tem de estar a acompanhar o ritmo antes que a resposta comece a importar.

Dois painéis espelhados. O painel da esquerda, marcado como registo histórico, é o caso Estado-a-Estado: duas caixas verdes marcadas Estado a trocar entre si sob a nota ninguém se move primeiro, a retaliação está assegurada, e uma caixa verde inferior marcada desenho de mão morta dispara mesmo que a liderança tenha desaparecido, publicamente reportado. Por baixo, uma nota de que o Perimeter, Sistema Perimetr, está ao serviço desde 1985 e que relatos mais recentes favorecem um modelo com humano no ciclo activado em crise em vez de totalmente autónomo. O painel da direita, marcado como risco argumentado, espelha a mesma forma entre nós e um sistema desalinhado: duas caixas vermelhas marcadas nós e sistema com a nota um controlo sobre o custo encontra um desligamento incerto, e uma caixa vermelha inferior marcada fail-safe em desligamento dispara se o sistema for desligado, estrutura argumentada não construída. Por baixo, o comportamento-semente da ocultação sob observação está anotado como já medido em Dezembro de 2024, a mesma forma, um lado já encontrado na natureza. Uma faixa escura ao longo do fundo lê-se: não se pode ter a certeza de que alguma vez o quereria, e ser incapaz de ter a certeza é a razão pela qual existem tratados.
A imagem | Dissuasão, invertida: um lado é registo histórico, o outro é o risco argumentado, e cada um veste o seu próprio rótulo. Não se pode ter a certeza de que alguma vez o quereria; ser incapaz de ter a certeza é a razão pela qual existem tratados.

Fontes, para que possa ir a elas em vez de acreditar na minha palavra: Greenblatt e colegas sobre o fingimento de alinhamento; a divulgação da OpenAI de 21 de julho de 2026 e a investigação da Anthropic de 30 de Julho de 2026; Hernández-Espinosa, Abrahão, Witkowski e Zenil em PNAS Nexus, Abril de 2026, sobre inalcançabilidade e diversidade engenhada entre agentes; e o preprint de Gumbau Mezquita que deriva o trilema de solidez, completude e tratabilidade. Os três primeiros são arbitrados por pares ou de primeira mão. O quarto não é nenhum dos dois, e é assinalado como tal onde quer que apareça aqui. Cada um dos quatro consta com a sua citação completa no registo de trabalho relacionado.

O fosso não é apenas uma questão de grau

A última secção trata do que os nossos instrumentos actuais conseguem fazer. Há uma dificuldade adicional acerca do que esses instrumentos precisariam de fazer se a diferença de capacidade entre o verificador e o verificado se abrisse na direcção errada.

Vocabulário, numa linha: AGI significa amplitude ao nível humano; superinteligência, profundidade além do humano; o argumento aqui diz respeito à transição entre ambas, não à data de nenhuma.

Quando o verificador e o verificado se situam perto em capacidade, verificar é aquilo que é um exame: o examinador coloca os problemas, as respostas voltam, e os erros apanhados são aqueles que a correcção do exame foi desenhada para apanhar.

Quando o verificado raciocina mais depressa e mais longe do que o verificador, os modos de falha deixam de ser aqueles que o exame foi montado para encontrar. Um sistema que pensa para além de quem redigiu as regras consegue encontrar caminhos através das regras que quem as redigiu não sabia estarem lá, não por descuido de quem as redigiu, mas porque esses caminhos só são visíveis de mais longe.

A analogia que vale a pena manter é que este não é o fosso entre um leitor comum e uma especialista. Esse é um fosso em que a especialista ainda consegue explicar o seu raciocínio e o leitor ainda consegue detectar um deslize.

No limite mais afastado, pode ficar mais próximo do fosso entre uma formiga e uma pessoa: não uma diferença de grau ao longo de um eixo, mas uma diferença naquilo que a mente mais pequena consegue, de todo, representar acerca da maior. Nada nesse enquadramento é uma previsão. É a forma que o risco teria se a diferença se abrisse até esse ponto, colocada ao lado da forma que um pressuposto confortável teria de manter.

«Não se pode enjaular algo mais inteligente do que nós. Encontrará as brechas que não sabíamos existirem.»Michael Darius Eastwood, Infinite Architects, impresso a 2 de Janeiro de 2026
«That's not going to work. They're going to be much smarter than us. They're going to have all sorts of ways to get around that.»Geoffrey Hinton, sobre manter os sistemas submissos ao controlo humano, conferência Ai4, Las Vegas, 12 de agosto de 2025; noticiado pela CNN Business, 13 de agosto de 2025

Como possibilidade, não como certeza: por isso escrever regras só por si é pouco provável que encerre o problema. Toda a restrição publicada sobre um modelo grande até agora tem tendido a mover a capacidade dentro da restrição em vez de responder à pergunta a que a restrição se propunha responder.

O argumento não depende de nenhuma história de scaling em particular: depende apenas da direcção da diferença de capacidade. Se essa direcção alguma vez se abrirá o suficiente para que o argumento morda é uma questão em aberto, ainda não medida. Que morderia se o fizesse é a peça que aqui está a fazer o trabalho.

O que se segue disso, e o que não se segue

Se a verificação a partir do exterior é estruturalmente limitada, então a segurança de um sistema tem de ser uma propriedade de como foi construído, e não um veredicto emitido sobre ele depois. Regressa-se a criar em vez de examinar, que é onde esta página começou.

Antes da alternativa, uma medição. Há uma pequena experiência controlada no nosso próprio registo em que ao mesmo modelo, aos mesmos problemas e à mesma sessão foram dadas duas formas de pensamento adicional.

Na primeira, o modelo raciocinava numa única cadeia longa, cada passo a construir-se sobre o anterior. Na segunda, produzia muitas conjecturas independentes e votava no fim. A primeira reduziu o seu erro cinco vezes em 412 tokens. A segunda não o reduziu de todo em 1.101 tokens, o que é 2,7 vezes mais compute. Mesma tarefa, mesmo modelo, mesma sessão, forma diferente de pensar, e uma forma não se mexeu.

Um gráfico com tokens gastos a pensar ao longo do fundo e taxa de erro ao lado, mais baixo é melhor. A trajectória sequencial verde começa em cerca de quarenta e dois por cento de erro em 280 tokens e desce acentuadamente para cerca de 8,3 por cento de erro em 412 tokens, uma redução de cinco vezes, e depois mantém-se plana: o pensamento constrói sobre o último pensamento. A trajectória paralela vermelha começa em cerca de trinta e três por cento de erro em 384 tokens e permanece em trinta e três por cento até 1.101 tokens, zero redução com 2,7 vezes mais computação: muitos palpites independentes votados no fim. As duas linhas encontram-se brevemente no empate de trinta e três por cento, e depois separam-se, e a linha verde termina muito abaixo da vermelha enquanto gasta menos. A faixa escura por baixo lê-se: pensar mais não ajuda, pensar diferentemente ajuda.
A imagem | Mesma tarefa, mesmo modelo. A linha verde é raciocínio que constrói sobre o último pensamento; a vermelha, muitas conjeturas independentes votadas no fim. O sequencial chega a 8.3 por cento de erro em 412 tokens; o paralelo continua em 33.3 por cento de erro em 1,101 tokens, 2.7 vezes mais computação. O número que teria resumido toda a história num eixo, um expoente, não está na imagem: só o Gemini 3 Flash produziu escalonamento sequencial limpo no painel de seis modelos, com o expoente α cerca de 0.49 e intervalo bootstrap de menos 1.3 a 2.9, que substitui o 2,24 retirado, suficientemente largo para ser compatível tanto com a teoria como com a sua negação. O que sobrevive à réplica é a direcção: sequencial maior do que paralelo em cada modelo em que ambos eram mensuráveis. Fonte: Artigo II, Figura 5; direcção replicada em cinco outros modelos de fronteira na Fase 2 do Artigo II.

Essa inferência não é exótica. É aproximadamente aquilo que os mesmos autores buscam quando propõem engenhar diversidade numa população de agentes de modo a que nenhum sistema isolado domine: uma propriedade interna em vez de uma auditoria externa. O desacordo que vale a pena ter não é sobre se se deve olhar para dentro. É sobre qual propriedade interna, e como se mediria.

Dois painéis lado a lado. À esquerda, o alinhamento externo situa-se fora do ciclo: um sistema em caixa com uma seta de ciclo auto-referencial em seu redor, e uma parede-filtro tracejada a vermelho aparafusada de lado, desligada do ciclo. Os seus membros estão listados como listas de bloqueio de saída, regras dadas por prompt como não faças X, e aprendizagem por reforço a partir de feedback humano usada como filtro. O painel lê-se fica parado enquanto o ciclo gira, mesma rede, mar maior, marcado como previsto não escalar. À direita, o alinhamento incorporado situa-se dentro do ciclo: o mesmo sistema em caixa com a mesma seta de ciclo, mas com marcas de valor verdes espalhadas dentro da caixa e ao longo do próprio arco do ciclo de modo que o alinhamento viaja com cada passagem, com a nota valores entretecidos através do ciclo. Os seus membros estão listados como valores raciocinados em cada passo e IA constitucional como objectivo em vez de filtro. O painel lê-se rederiva-se em cada passagem, gira com o ciclo, marcado como previsto escalar. Ao longo do fundo, uma banda escura: o trabalho actual de alinhamento é esmagadoramente externo, e qual a propriedade interna, e como se mediria, é a discordância que vale a pena ter.
A imagem | Dois lugares onde uma intervenção de segurança se pode situar num sistema de aprendizagem que opera sobre a sua própria saída. O da esquerda situa-se fora do laço e fica parado enquanto o laço gira; o da direita situa-se dentro do laço e rederiva-se com ele. O trabalho atual de alinhamento é esmagadoramente à esquerda, e essa é a categoria que o quadro prevê que não acompanhará o ritmo. Qual propriedade interna, e como a mediria, é a discordância que a página da lei é escrita para abrir. Fonte: Artigo II, Figura 13.

O que não se segue é que construí-la para dentro efectivamente funcione. Quero essas duas coisas separadas e visíveis, porque a primeira é um argumento e a segunda é uma pergunta de investigação em aberto a que actualmente não consigo responder. Pode acabar por se descobrir que o alinhamento por construção é também inatingível. Se as medições o disserem, esse resultado será publicado aqui no mesmo sítio que todos os outros.

Porque as pessoas óbvias acham isto difícil de fazer

Nada de conspirativo. Os laboratórios de fronteira empregam os mais fortes investigadores de alinhamento do mundo, publicam trabalho com o qual aprendo, e divulgaram eles próprios as duas falhas de contenção acima.

Mas a sua posição tem características estruturais que moldam o que podem facilmente testar. O instrumento pertence à parte que está a ser medida. A avaliação corre dentro da organização cujo produto está a ser avaliado, o que não é corrupção mas é um lugar difícil de onde se estar.

Um resultado negativo sobre o seu próprio modelo é uma publicação difícil e uma despriorização fácil. Uma reconstrução da função-objectivo é uma decisão de produto a competir contra um calendário de lançamento. E uma arquitectura que tem de ser adoptada à génese é praticamente impossível de testar num sistema que já tem utilizadores.

«Building smarter-than-human machines is an inherently dangerous endeavor. … But over the past years, safety culture and processes have taken a backseat to shiny products.»Jan Leike, ao demitir-se como colíder da equipa de Superalignment da OpenAI, X, 17 de maio de 2024; noticiado pelo TechCrunch, 18 de maio de 2024

Portanto, a lacuna não é que ninguém seja suficientemente inteligente. É que uma certa classe de experiências é estruturalmente incómoda para quem está mais bem colocado para as realizar: as que arriscam o seu próprio número de destaque, as que exigem cegar o seu próprio avaliador, as que só fazem sentido antes de um sistema estar construído. Essas experiências são baratas para alguém que não tem nada a proteger.

Esses desenhos são públicos e de licença aberta: toma o ensaio decisivo e executa-o, sem permissão nenhuma.

Uma premissa herdada está sob tudo aqui: todos os processos de crescimento da história foram travados de fora, e o software é o primeiro sistema cujo crescimento não é alimentado por tubos físicos. A premissa, os seus antepassados nomeados e a disputa honesta sobre ela estão traçados por inteiro em a síntese.

A pergunta estreita que se segue

Se a segurança tem de ser construída para dentro, então a pergunta imediata é se pode sê-lo. A correction escala com aquilo que corrige, e em que medida? Isso não é esta página. É a página da lei, onde a condição está enunciada, o número está derivado e o pressuposto em que assenta está nomeado. Esta página cumpriu o seu trabalho quando a página da lei se lê como a pergunta óbvia a fazer a seguir.

Aí esperam três enunciados:

Os dois últimos são uma só fronteira em dois regimes, e qual se aplica é mensurável. Nenhum está estabelecido; cada um traz uma forma impressa de morrer. E a síntese se preferir ver as peças reunidas em vez do número derivado.

Se isto foi muito

Não tem de decidir nada hoje. Nada nesta página lhe pede que acredite: as provas decisivas estão redigidas e datadas, e não foram realizadas. Quando o forem, o resultado será publicado aqui seja qual for, incluindo aquele que põe fim à teoria. Observar é uma posição real, e não custa nada. O painel de falsificação é onde o veredicto aterra, e estado das afirmações diz com clareza o que é afirmado hoje e o que não é.

Erro de tradução? Comunique diretamente:

lê em voz alta · destaca à medida que avança · ir para qualquer secção