| name | computer-vision |
| description | Build computer vision solutions - image classification, object detection, and transfer learning |
| version | 1.4.0 |
| sasmp_version | 1.4.0 |
| bonded_agent | 06-computer-vision |
| bond_type | PRIMARY_BOND |
| parameters | {"required":[{"name":"images","type":"tensor|array","validation":"4D tensor [B, C, H, W] or list of images"}],"optional":[{"name":"model_name","type":"string","default":"efficientnet_b0"},{"name":"num_classes","type":"integer","default":1000}]} |
| retry_logic | {"strategy":"exponential_backoff","max_attempts":3,"base_delay_ms":1000} |
| logging | {"level":"info","metrics":["inference_time","batch_size","image_size"]} |
Computer Vision Skill
Build visual AI systems from classification to detection.
Quick Start
import torch
import timm
from PIL import Image
from torchvision import transforms
model = timm.create_model('efficientnet_b0', pretrained=True, num_classes=10)
model.eval()
transform = transforms.Compose([
transforms.Resize(256),
transforms.CenterCrop(224),
transforms.ToTensor(),
transforms.Normalize([0.485, 0.456, 0.406], [0.229, 0.224, 0.225])
])
image = Image.open('image.jpg').convert('RGB')
input_tensor = transform(image).unsqueeze(0)
with torch.no_grad():
output = model(input_tensor)
predicted_class = output.argmax(dim=1).item()
Key Topics
1. Data Augmentation
import albumentations as A
from albumentations.pytorch import ToTensorV2
train_transform = A.Compose([
A.RandomResizedCrop(224, 224, scale=(0.8, 1.0)),
A.HorizontalFlip(p=0.5),
A.ShiftScaleRotate(shift_limit=0.1, scale_limit=0.1, rotate_limit=15),
A.ColorJitter(brightness=0.2, contrast=0.2),
A.Normalize(mean=[, , ], std=[, , ]),
ToTensorV2()
])
val_transform = A.Compose([
A.Resize(, ),
A.CenterCrop(, ),
A.Normalize(mean=[, , ], std=[, , ]),
ToTensorV2()
])