Converter webarchive para html

Converter WEBARCHIVE para HTML

Extraia o conteúdo do Safari WEBARCHIVE como HTML editável e compatível com navegadores.

Crie ficheiros HTML online

Ainda não conseguimos ler ficheiros WEBARCHIVE, por isso esta conversão não está disponível. Se conseguir exportar o seu trabalho para um destes formatos ou outros, transformamo-lo em HTML:

Como converter webarchive para html arquivo

  • Internet

Um arquivo Safari archive pode precisar de conversão quando um editor, servidor web ou navegador que não seja da Apple exige um arquivo .html comum. Convertê-lo também torna o documento mais fácil de inspecionar, editar ou compartilhar sem o Safari.

O que é o formato .webarchive

Um arquivo .webarchive geralmente é um arquivo binário Apple property-list criado pelo Safari ou por outro aplicativo baseado em WebKit. Ele pode conter o HTML da página, imagens, folhas de estilo, scripts, fontes e metadados em um único arquivo, permitindo que uma cópia offline seja reaberta com grande parte de sua aparência original.

O Safari cria um arquivo desse tipo por meio de File → Save As quando Web Archive é selecionado como formato. WEBARCHIVE é um contêiner associado à Apple, não um formato padrão compatível com todos os navegadores ou servidores web.

O que é o formato .html

HTML é a linguagem de marcação padrão usada em páginas web. Um arquivo .html pode ser aberto em navegadores modernos, editado em um editor de código, publicado em um servidor web e processado por ferramentas de indexação ou de documentos sem o Safari.

Normalmente, HTML contém referências a arquivos separados de imagens, CSS, JavaScript e fontes. Alterar a extensão ou extrair apenas o recurso principal não cria automaticamente uma cópia offline completa.

Converta-o com o Safari no macOS

  1. Abra o arquivo .webarchive no Safari.
  2. Selecione File → Save As.
  3. No menu de formato, escolha Page Source ou Page Source HTML, dependendo da versão do Safari.
  4. Salve o arquivo com uma extensão .html.

Este é o método de desktop mais rápido, mas as versões do Safari variam. Algumas instalações exibem apenas Web Archive na caixa de diálogo de salvamento; nesse caso, use o método de extração abaixo. O código-fonte exportado pode não incluir todos os sub-recursos arquivados em um diretório local separado.

Extraia o recurso principal com Python

A biblioteca padrão do Python pode ler a estrutura binária de property-list sem instalar um conversor. Salve isto como extract_webarchive.py:

import plistlib
import sys

source, destination = sys.argv[1], sys.argv[2]
with open(source, 'rb') as file:
    archive = plistlib.load(file)

main = archive['WebMainResource']
data = main['WebResourceData']
if not isinstance(data, bytes):
    raise TypeError('WebResourceData is not binary data')

with open(destination, 'wb') as file:
    file.write(data)

Execute-o no Terminal, Command Prompt ou PowerShell com Python 3:

python3 extract_webarchive.py "saved-page.webarchive" "saved-page.html"

A saída normalmente é o recurso HTML principal do arquivo. Verifique o WebResourceMIMEType do arquivo se a saída não for texto legível; o recurso principal pode ser, em vez disso, um PDF, uma imagem ou outro tipo de arquivo.

Conversão online e alternativas para desktop

O Safari é adequado para uma conversão ocasional no macOS, enquanto o método com Python pode ser repetido e funciona em outros sistemas com Python 3. Para um arquivo que não contenha informações confidenciais, CloudConvert ou Zamzar podem ser considerados somente se a lista de formatos atual do serviço oferecer explicitamente .webarchive como entrada e HTML como saída. O upload de um arquivo pode divulgar o conteúdo da página, dados incorporados, URLs ou informações relacionadas à autenticação, e o suporte online a esse formato específico da Apple é inconsistente.

Limitações de qualidade e compatibilidade

  • O HTML extraído ainda pode fazer referência ao site original, portanto imagens e estilos podem desaparecer offline ou após alterações no site.
  • JavaScript que dependa de APIs do Safari, cookies, armazenamento local, autenticação, solicitações do lado do servidor ou serviços externos pode não funcionar após a extração.
  • Uma cópia offline completa exige a extração dos sub-recursos listados no array WebSubresources do arquivo, a gravação deles em um diretório de recursos e a reescrita das referências do HTML. O script simples extrai apenas WebMainResource.
  • O recurso principal pode representar o código-fonte do documento original, e não o DOM final produzido por JavaScript. Verifique o resultado em um navegador e inspecione seus links de imagens, folhas de estilo e scripts.
  • Salvar em HTML altera o formato do contêiner; isso não preserva todos os metadados do arquivo Safari archive nem garante uma renderização pixel a pixel idêntica.

Comparação de formato: WEBARCHIVE vs HTML

Como os formatos WEBARCHIVE e HTML se comparam nas propriedades mais importantes para esta conversão.

Comparação dos formatos de arquivo WEBARCHIVE e HTML
Propriedade .WEBARCHIVE Safari Web Archive .HTML HyperText Markup Language
Abre num navegador web Não Sim, nativamente
Legível em texto simples — Sim
Formatação de texto Básico Extenso
Imagens Sim Sim
Elementos interativos Limitado Sim
Edição posterior Limitado Fácil
Tamanho típico do arquivo Grande Pequeno
Padrão aberto Não Sim
Introduzido 2003 1993
Desenvolvedor Apple Inc. W3C / WHATWG
Tipo MIME application/x-webarchive text/html

Outras conversões de arquivo .webarchive

Converter para .html
de outros formatos

Compartilhar nas redes sociais: