Computer vision: šta model može da izvuče iz slike?
Sistemi mašinskog vida mogu da klasifikuju sliku, detektuju objekte, segmentiraju regione, očitaju tekst i povežu vizuelne obrasce. Konkretan Google pipeline nije javno opisan kao jedna jednostavna sekvenca koraka.
Koja je razlika između glavnih zadataka?
| Zadatak | Rezultat | SEO primer |
|---|---|---|
| Klasifikacija | Kategorija cele slike | Patika, automobil, torta |
| Detekcija | Objekat i okvir | Više proizvoda u kadru |
| Segmentacija | Regioni/pikseli objekta | Odvajanje proizvoda od pozadine |
| OCR | Tekst sa slike | Etiketa ili naziv modela |
| Embedding/podudaranje | Vizuelna sličnost | Slični proizvodi ili prizori |
Šta iz toga praktično sledi?
Prikaži predmet dovoljno jasno za zadatak korisnika, obezbedi koristan kontekst na stranici i ne očekuj da alt tekst „prepiše“ ono što slika ne pokazuje. Za kontrolni primer otvori praktičan vodič za vizuelnu pretragu.
Koji zadatak odgovara kojoj odluci na sajtu?
Podela na zadatke nije akademska. Svaki od njih odgovara drugoj odluci pri pripremi slika, i greška u pretpostavci vodi na pogrešnu optimizaciju.
| Zadatak | Šta iz njega sledi za tvoje slike |
|---|---|
| Klasifikacija | Predmet mora biti prepoznatljiv iz jednog kadra. Umetnički kadar koji seče proizvod otežava svrstavanje. |
| Detekcija | Ako je u kadru više proizvoda, nijedan nije jasno glavni. Za produktnu fotografiju radi zaseban kadar po proizvodu. |
| Segmentacija | Kontrast prema pozadini pomaže izdvajanju. Zato studijska pozadina radi bolje od zatrpanog stola. |
| OCR | Tekst sa slike može biti očitan, ali se na njega ne oslanjaj — isti tekst mora postojati i kao pravi tekst. |
| Podudaranje | Doslednost kadra kroz katalog pomaže poređenju više nego pojedinačno savršena fotografija. |
Šta pouzdano možeš da uradiš
Arhitektura sistema nije javna, ali skup postupaka koji ne zavise od nje ipak postoji.
- Jedan predmet, jedan kadar za slike koje treba da se prepoznaju kao proizvod.
- Dovoljna rezolucija uz razumnu kompresiju. Detalj koji nije u pikselima ne može biti izvučen; datoteka koja koči učitavanje šteti na drugom mestu.
- Kontekst na stranici oko slike. Naslov sekcije, okolni tekst i natpis nose značenje koje sama slika ne mora da sadrži.
- Dosledna terminologija između alt teksta, natpisa i teksta stranice — ne mehaničko ponavljanje iste rečenice, nego isti pojmovi za istu stvar.
- Stabilni URL-ovi slika. Promena putanje poništava sve što je sistem o toj slici već naučio.
- Strukturirani podaci gde su primenljivi, sa punim
ImageObjectčvorom umesto golog URL-a.
Česte pogrešne pretpostavke
| Pretpostavka | Šta zapravo važi |
|---|---|
| Model „čita“ alt tekst da bi razumeo sliku | Alt je jedan od signala uz sam sadržaj slike i kontekst stranice, ne uputstvo modelu |
| Veća slika uvek daje bolji rezultat | Postoji tačka posle koje dodatni pikseli ne nose novi detalj, a šteta po brzinu je stvarna |
| Vodeni žig ne smeta | Preko predmeta može da oteža segmentaciju i prepoznavanje |
| Dovoljno je imenovati fajl opisno | Google ga opisuje kao vrlo blag signal; kontekst stranice nosi više |
Šta se nalazi u samoj datoteci
Slika nosi i podatke koji nisu piksel: EXIF, IPTC i XMP. Google navodi da čita IPTC polja o autorskim pravima i licenci, a ta polja se prikazuju korisniku u Google Images.
| Standard | Tipičan sadržaj | SEO značaj |
|---|---|---|
| EXIF | Uređaj, ekspozicija, datum, ponekad GPS | Mali; GPS koordinate obavezno ukloni pre objave |
| IPTC | Autor, nosilac prava, opis, uslovi korišćenja | Google ih čita i prikazuje u panelu slike |
| XMP | Prošireni opisi, istorija obrade | Koristan za interno upravljanje sadržajem |
Dve praktične posledice. Prvo, GPS koordinate iz fotografija snimljenih telefonom odaju lokaciju i treba ih ukloniti — osim ako lokacija namerno nije deo informacije. Drugo, alati za kompresiju često brišu sve metapodatke zajedno, uključujući i polja o licenci koja želiš da zadržiš. Proveri šta tvoj alat radi.
Odnos prema strukturiranim podacima: IPTC polja i ImageObject u JSON-LD-u nisu zamena jedno za drugo. Podaci u datoteci putuju sa slikom kada je neko preuzme; strukturirani podaci opisuju sliku u kontekstu stranice. Za podobnost za oznaku licenciranja Google traži strukturirane podatke ili IPTC, ali dosledno je imati oba.
Video i pokretni sadržaj
Za video sistem ne analizira samo sličice nego i transkript, poglavlja i strukturirane podatke. Najveći deo onoga što pretraživač razume o videu dolazi iz teksta koji ide uz njega, ne iz same slike.
| Element | Zašto |
|---|---|
| Transkript na stranici | Jedini deo sadržaja koji je u potpunosti čitljiv i pretraživ |
| Titlovi kao poseban fajl | Pristupačnost i razumevanje sadržaja, nezavisno od transkripta |
VideoObject markup | thumbnailUrl, uploadDate, duration, contentUrl |
| Poglavlja sa vremenskim oznakama | Podobnost za prikaz ključnih trenutaka |
| Namenska sličica | Prvi kadar je retko najinformativniji kadar |
Isto načelo važi i za animirani sadržaj i za dijagrame koji se generišu skriptom: ako informacija postoji samo u pokretu ili tek posle izvršavanja skripte, za deo sistema ona ne postoji.
Kako se meri da li slike uopšte rade
U Search Console-u postoji zaseban tip pretrage za slike. Bez razdvajanja tog izveštaja od veb pretrage, ne znaš da li slike donose bilo šta.
- Razdvoji tip pretrage. U izveštaju o učinku promeni tip sa „Veb“ na „Slika“ i uporedi prikaze i klikove.
- Pogledaj koje stranice dobijaju te klikove. Često nisu one na kojima si najviše radio.
- Proveri indeksiranost slika kroz sitemap za slike i izveštaje o pokrivenosti.
- Meri po grupi, ne po pojedinačnoj slici. Jedna slika retko daje signal iz kojeg se nešto zaključuje.
- Beleži datum svake veće izmene u obradi slika, inače kasnije ne možeš da pripišeš promenu.
Ograničenje merenja: Search Console ne izveštava odvojeno o Google Lens-u ni o tome koliko puta je slika korišćena u generisanom odgovoru. Prikazi u AI funkcijama pretrage postoje kao zaseban izveštaj, ali se ne razlažu po slici. Zaključci o vizuelnoj pretrazi zato ostaju posredni.
Tehnička priprema koja utiče na obradu
| Odluka | Preporuka | Razlog |
|---|---|---|
| Format | WebP ili AVIF, uz JPEG samo gde je nužno | Manja datoteka pri istom kvalitetu |
| Dimenzije | Više veličina preko srcset | Telefon ne treba da preuzima sliku za monitor |
Atributi width i height | Uvek navedeni | Sprečavaju pomeranje rasporeda pri učitavanju |
loading | lazy za sve osim prve vidljive slike | Odlaganje glavne slike pogoršava učitavanje |
| Naziv datoteke | Opisan, bez dijakritike i razmaka | Blag signal, ali besplatan |
| Putanja | Stabilna, bez heša koji se menja pri svakoj izmeni | Promena putanje poništava istoriju slike |
Poslednji red je najčešće previđen na sajtovima koji koriste alate za pakovanje. Ako se ime datoteke menja pri svakom objavljivanju, svaka slika je za pretraživač nova slika bez istorije.
Granica onoga što se može tvrditi
Ova stranica opisuje tipove zadataka i postupke koji iz njih slede. Ne opisuje kako Google interno kombinuje te zadatke, jer to nije javno.
| Tvrdnja | Status |
|---|---|
| Google kombinuje alt tekst, sadržaj stranice i algoritme mašinskog vida | Potvrđeno u dokumentaciji |
| Google čita IPTC polja o pravima i licenci | Potvrđeno u dokumentaciji |
| Naziv datoteke je vrlo blag signal | Navedeno od strane Google-a |
| Studijska pozadina olakšava izdvajanje predmeta | Izvedeno iz prirode zadatka segmentacije, nije Google tvrdnja |
| Doslednost kadra kroz katalog pomaže podudaranju | Naša radna pretpostavka, nije merena |
Česta pitanja
Da li Google koristi jedan isti pipeline za sve slike?
Google potvrđuje da kombinuje alt tekst, sadržaj stranice i algoritme mašinskog vida, ali ne objavljuje potpunu arhitekturu niti jedinstven redosled koraka.
Da li studijska pozadina uvek daje bolji rezultat?
Za produktne fotografije kontrast prema pozadini olakšava izdvajanje predmeta. Za sadržaj gde je kontekst deo informacije, prirodan kadar može biti prikladniji.
Da li vodeni žig šteti?
Preko samog predmeta može da oteža segmentaciju i prepoznavanje. Diskretan žig van predmeta je manji problem.