Converter WEBARCHIVE para HTML
Extraia o conteúdo do Safari WEBARCHIVE como HTML editável e compatível com navegadores.
Crie ficheiros HTML online
Ainda não conseguimos ler ficheiros WEBARCHIVE, por isso esta conversão não está disponível. Se conseguir exportar o seu trabalho para um destes formatos ou outros, transformamo-lo em HTML:
Como converter webarchive para html arquivo
- Internet
- Nenhuma avaliação ainda.
Um arquivo Safari archive pode precisar de conversão quando um editor, servidor web ou navegador que não seja da Apple exige um arquivo .html comum. Convertê-lo também torna o documento mais fácil de inspecionar, editar ou compartilhar sem o Safari.
O que é o formato .webarchive
Um arquivo .webarchive geralmente é um arquivo binário Apple property-list criado pelo Safari ou por outro aplicativo baseado em WebKit. Ele pode conter o HTML da página, imagens, folhas de estilo, scripts, fontes e metadados em um único arquivo, permitindo que uma cópia offline seja reaberta com grande parte de sua aparência original.
O Safari cria um arquivo desse tipo por meio de File → Save As quando Web Archive é selecionado como formato. WEBARCHIVE é um contêiner associado à Apple, não um formato padrão compatível com todos os navegadores ou servidores web.
O que é o formato .html
HTML é a linguagem de marcação padrão usada em páginas web. Um arquivo .html pode ser aberto em navegadores modernos, editado em um editor de código, publicado em um servidor web e processado por ferramentas de indexação ou de documentos sem o Safari.
Normalmente, HTML contém referências a arquivos separados de imagens, CSS, JavaScript e fontes. Alterar a extensão ou extrair apenas o recurso principal não cria automaticamente uma cópia offline completa.
Converta-o com o Safari no macOS
- Abra o arquivo
.webarchiveno Safari. - Selecione File → Save As.
- No menu de formato, escolha Page Source ou Page Source HTML, dependendo da versão do Safari.
- Salve o arquivo com uma extensão
.html.
Este é o método de desktop mais rápido, mas as versões do Safari variam. Algumas instalações exibem apenas Web Archive na caixa de diálogo de salvamento; nesse caso, use o método de extração abaixo. O código-fonte exportado pode não incluir todos os sub-recursos arquivados em um diretório local separado.
Extraia o recurso principal com Python
A biblioteca padrão do Python pode ler a estrutura binária de property-list sem instalar um conversor. Salve isto como extract_webarchive.py:
import plistlib
import sys
source, destination = sys.argv[1], sys.argv[2]
with open(source, 'rb') as file:
archive = plistlib.load(file)
main = archive['WebMainResource']
data = main['WebResourceData']
if not isinstance(data, bytes):
raise TypeError('WebResourceData is not binary data')
with open(destination, 'wb') as file:
file.write(data)
Execute-o no Terminal, Command Prompt ou PowerShell com Python 3:
python3 extract_webarchive.py "saved-page.webarchive" "saved-page.html"
A saída normalmente é o recurso HTML principal do arquivo. Verifique o WebResourceMIMEType do arquivo se a saída não for texto legível; o recurso principal pode ser, em vez disso, um PDF, uma imagem ou outro tipo de arquivo.
Conversão online e alternativas para desktop
O Safari é adequado para uma conversão ocasional no macOS, enquanto o método com Python pode ser repetido e funciona em outros sistemas com Python 3. Para um arquivo que não contenha informações confidenciais, CloudConvert ou Zamzar podem ser considerados somente se a lista de formatos atual do serviço oferecer explicitamente .webarchive como entrada e HTML como saída. O upload de um arquivo pode divulgar o conteúdo da página, dados incorporados, URLs ou informações relacionadas à autenticação, e o suporte online a esse formato específico da Apple é inconsistente.
Limitações de qualidade e compatibilidade
- O HTML extraído ainda pode fazer referência ao site original, portanto imagens e estilos podem desaparecer offline ou após alterações no site.
- JavaScript que dependa de APIs do Safari, cookies, armazenamento local, autenticação, solicitações do lado do servidor ou serviços externos pode não funcionar após a extração.
- Uma cópia offline completa exige a extração dos sub-recursos listados no array
WebSubresourcesdo arquivo, a gravação deles em um diretório de recursos e a reescrita das referências do HTML. O script simples extrai apenasWebMainResource. - O recurso principal pode representar o código-fonte do documento original, e não o DOM final produzido por JavaScript. Verifique o resultado em um navegador e inspecione seus links de imagens, folhas de estilo e scripts.
- Salvar em HTML altera o formato do contêiner; isso não preserva todos os metadados do arquivo Safari archive nem garante uma renderização pixel a pixel idêntica.
Comparação de formato: WEBARCHIVE vs HTML
Como os formatos WEBARCHIVE e HTML se comparam nas propriedades mais importantes para esta conversão.
| Propriedade | .WEBARCHIVE Safari Web Archive | .HTML HyperText Markup Language |
|---|---|---|
| Abre num navegador web | Não | Sim, nativamente |
| Legível em texto simples | — | Sim |
| Formatação de texto | Básico | Extenso |
| Imagens | Sim | Sim |
| Elementos interativos | Limitado | Sim |
| Edição posterior | Limitado | Fácil |
| Tamanho típico do arquivo | Grande | Pequeno |
| Padrão aberto | Não | Sim |
| Introduzido | 2003 | 1993 |
| Desenvolvedor | Apple Inc. | W3C / WHATWG |
| Tipo MIME | application/x-webarchive | text/html |