Durante alguns anos, falar em VSEO (Voice Search Engine Optimization) significava principalmente pensar em consultas feitas por voz. A recomendação mais comum era observar perguntas mais longas, aproximar a linguagem do jeito como as pessoas falam e tentar conquistar respostas curtas nos resultados do Google.
Essa abordagem ainda tem utilidade, mas ficou pequena diante da evolução da busca dos tempos modernos, que inclusive, estão mudando em velocidade exponencial nos últimos anos!
Hoje, uma pessoa pode falar uma pergunta para um celular, um alto-falante (por exemplo, Alexa), um carro ou outra interface conectada, a resposta pode vir de uma página da web, de uma informação local, de um mecanismo de busca ou de uma experiência que combina diferentes fontes. O que acontece depois também importa. A pessoa pode continuar a conversa, abrir uma página, ligar para uma empresa, pedir uma rota ou simplesmente encerrar a pesquisa depois de ouvir a resposta.
Por isso, VSEO precisa ser analisado em uma camada mais profunda. A questão envolve a forma como o conteúdo é escrito, a maneira como uma página está estruturada e a capacidade de determinados trechos serem compreendidos quando apresentados em áudio.
É nesse ponto que o speakable merece atenção.
A propriedade speakable, definida pelo Schema.org, identifica partes de uma página consideradas especialmente adequadas para conversão de texto em fala. O Google utiliza essa marcação em uma experiência específica do Google Assistente, voltada a consultas de notícias em dispositivos com suporte a reprodução por voz. A documentação atual do Google classifica o recurso como beta. (Google for Developers).
O speakable existe e está documentado, mas ao mesmo tempo, sua aplicação documentada pelo Google é bastante mais específica do que muitas explicações sobre VSEO encontradas na internet fazem parecer.
O que é o Speakable
No Schema.org, speakable é uma propriedade que pode ser utilizada em Article e WebPage. Sua função é indicar seções de uma página que são particularmente apropriadas para conversão de texto em fala.
O próprio Schema.org explica que outras partes de uma página também podem ser úteis em determinadas situações. A marcação serve para destacar aquelas que têm maior probabilidade de serem úteis em uma experiência de fala. A propriedade pode apontar para trechos usando referências por ID, seletores CSS ou XPath, por meio de SpeakableSpecification.
O objetivo não é simplesmente declarar que uma página inteira deve ser lida em voz alta. O Google recomenda concentrar a marcação nos pontos principais. Isso permite que o usuário tenha uma compreensão adequada do assunto sem precisar ouvir uma página inteira, algo especialmente importante quando a interação acontece por áudio.
Essa orientação também influencia a produção editorial.
Um trecho destinado a ser ouvido precisa funcionar sozinho. Uma frase que depende de uma tabela que aparece logo abaixo, de uma legenda ou de uma referência visual pode funcionar bem no texto mas ser ruim quando isolada em áudio.
O Google tem uma aplicação específica para Speakable
A documentação oficial do Google é bastante clara sobre o cenário atual. O Google Assistente utiliza speakable para responder a consultas de notícias sobre determinados assuntos em alto-falantes inteligentes. Quando o usuário solicita notícias sobre um tema, o Assistente pode retornar até três artigos de diferentes publicações e utilizar conversão de texto em fala para reproduzir os trechos marcados. Durante a leitura, o Assistente atribui a origem e envia o endereço completo do artigo ao dispositivo móvel do usuário pelo aplicativo do Google Assistente.
Uma coisa é a existência de busca por voz e de interfaces que aceitam consultas faladas. Outra é o uso específico da propriedade speakable pelo Google em uma experiência documentada.
A documentação atual informa que essa implementação funciona para usuários nos Estados Unidos com dispositivos Google Home configurados em inglês e para publishers que publicam conteúdo em inglês. O Google também informa que espera ampliar a disponibilidade para outros países e idiomas quando houver uma quantidade suficiente de publishers utilizando a propriedade.
Portanto, um site brasileiro em português não deveria publicar um artigo afirmando que basta adicionar speakable para começar a aparecer em respostas de voz do Google.
A documentação disponível não sustenta essa promessa (ao menos, não até o momento em que esse artigo é publicado).
Por que o Speakable continua sendo importante para quem trabalha com SEO
Apesar de o cenário para nós brasileiros não ser o melhor á curto prazo, a limitação atual da implementação não diminui o valor conceitual da estratégia.
O speakable mostra que existe uma necessidade técnica real de identificar trechos de uma página que funcionem bem quando transformados em áudio. Isso aproxima SEO, estrutura de conteúdo, acessibilidade, publicação digital e tecnologias de voz.
O Schema.org define speakable de maneira ampla. A propriedade representa partes de uma página que são especialmente adequadas para conversão em texto para fala. O vocabulário permite referências por URL, ID, CSS Selector e XPath, oferecendo diferentes formas de indicar exatamente quais trechos devem ser considerados.
Essa lógica pode ser aplicada editorialmente mesmo quando o recurso específico do Google não estiver disponível para determinado site.
Se uma página contém uma definição importante, uma explicação central ou um resumo que consegue transmitir o essencial do assunto em poucas frases, esse trecho possui uma qualidade que vale a pena considerar.
A escrita para voz começa antes do código
É tentador transformar VSEO em uma tarefa técnica. Instalar uma marcação, validar o JSON-LD e procurar algum sinal no Search Console parece mais objetivo do que discutir qualidade editorial.
Mas o problema começa antes da implementação.
O Google orienta que o conteúdo indicado por speakable tenha títulos e resumos concisos capazes de fornecer informações compreensíveis e úteis. Quando o início de uma matéria é utilizado, a recomendação é escrever as informações em frases individuais para melhorar a leitura pelo sistema de texto para fala. Para uma boa experiência de áudio, o Google recomenda aproximadamente 20 a 30 segundos por seção marcada, o equivalente a cerca de duas ou três frases.
Essa orientação sugere que o trecho selecionado precisa ter densidade informativa suficiente para funcionar sozinho, sem transformar a resposta em uma sequência telegráfica de frases.
Vamos dar um exemplo prático, uma página sobre SEO semântico pode conter esta explicação:
“SEO semântico é uma abordagem que considera o significado dos termos, as entidades relacionadas e o contexto de uma consulta. Em vez de trabalhar apenas com correspondência de palavras-chave, a análise procura entender como conceitos diferentes se relacionam dentro de um assunto.”
Esse trecho pode ser ouvido sem depender do restante do artigo.
O que faz uma resposta funcionar bem em áudio
Fato é que, para uma resposta ser devidamente destinada à leitura por voz, ela precisa ter contexto!
Isso não significa que todo parágrafo precise ser curto. Um artigo pode continuar aprofundado, denso, argumentativo e detalhado, a questão está em selecionar determinados trechos capazes de representar o assunto com clareza.
O próprio Google recomenda que os pontos principais sejam priorizados e que conteúdos potencialmente confusos em uma experiência exclusivamente de voz sejam evitados. A documentação cita como exemplos linhas de data, legendas de fotos e atribuições de fonte.
Gostaria de pontuar algo que, se caso você pudesse guardar apenas uma única frase sobre esse texto todo, seria:
“A qualidade de uma frase depende do contexto em que ela será consumida.”
Uma legenda pode ser perfeitamente compreensível visualmente porque está ao lado de uma imagem. Já quando reproduzida sozinha, pode deixar de explicar o que o usuário está ouvindo.
Um título pode ser excelente para uma página e insuficiente como resposta falada.
Reflita sobre isso antes de sair inserindo marcações em todo seu site!
O conteúdo precisa continuar humano
Contemporaneamente, há uma tentação recorrente quando um novo formato de busca aparece: alterar artificialmente a maneira de escrever para tentar se adaptar ao mecanismo.
Todos sabemos que Isso produz textos cheios de perguntas artificiais, frases repetidas e respostas que parecem montadas para uma ferramenta (Com certeza até mesmo leigos em tecnologia conseguem identificar textos com ‘vícios de IAs’, e isso não é nada benéfico para experiência do usuário).
Como aplicar os dados estruturados de speakable
No caso de speakable , a propriedade pode indicar trechos especialmente adequados para conversão em fala. O vocabulário atual permite que speakable seja utilizado em Article e WebPage, com valores que podem ser uma URL ou uma SpeakableSpecification. (Schema.org). A especificação também permite indicar conteúdo por ID, CSS Selector ou XPath.
Isso significa que a implementação pode apontar para partes específicas da página em vez de depender de uma interpretação vaga sobre quais trechos devem ser lidos. Na prática, uma implementação pode usar JSON-LD para descrever a página e indicar seletores correspondentes aos elementos que devem ser considerados.
Um exemplo conceitual seria:
{
“@context”: “https://schema.org”,
“@type”: “Article”,
“name”: “O que é VSEO?”,
“speakable”: {
“@type”: “SpeakableSpecification”,
“cssSelector”: [
“.resumo”,
“.resposta-principal”
]
}
}
Esse exemplo demonstra a estrutura. Os seletores precisam corresponder aos elementos que realmente existem na página.
O Google documenta o uso de cssSelector ou xPath para SpeakableSpecification e orienta a utilização de apenas um desses métodos na implementação correspondente.
O que vale fazer agora
Para quem trabalha com SEO, o caminho mais consistente é começar pelo conteúdo e pela intenção, identificar as dúvidas que realmente existem no mercado e entender quais são informacionais e quais dependem do contexto local.
Organize as respostas dentro de páginas que tenham uma função clara, revise os trechos mais importantes para garantir que possam ser compreendidos isoladamente e mantenha informações empresariais atualizadas quando houver uma dimensão local.
Por fim, avalie se dados estruturados podem representar corretamente aquilo que já está na página. No caso de speakable, siga a documentação do Google e do Schema.org. A documentação atual é específica quanto ao cenário suportado, às diretrizes de conteúdo e às formas de implementação.
Conclusão
O Google informa que o recurso está em beta e documenta sua utilização para consultas de notícias em inglês nos Estados Unidos, com Google Assistant e dispositivos Google Home configurados para inglês. Ao mesmo tempo, o conceito oferece uma lição muito mais ampla para nosso tão amado ecossistema do SEO.
O conteúdo precisa ter significado mesmo quando retirado do contexto visual. Respostas precisam apresentar informação suficiente para serem compreendidas. Entidades e informações locais precisam estar corretas. Dados estruturados precisam representar o conteúdo real. E a linguagem precisa continuar natural.
O trabalho de VSEO começa, portanto, na pergunta que deu origem à busca, depois passa pela qualidade da resposta e somente então, chega à tecnologia que pode ajudar os mecanismos a identificar e utilizar aquela informação.
No fim, o objetivo não deveria ser fazer uma página “parecer otimizada para voz”.
O objetivo é produzir informação que uma pessoa consiga entender quando lê, quando ouve e quando encontra em diferentes formas de busca!